中文

基于因果推理的视频-based 人体姿态估计多任务学习

计算机视觉与模式识别 2025-01-27 v1

摘要

视频-based 人体姿态估计长期以来是计算机视觉中的一个基础且具挑战性的问题。以往研究聚焦于通过增强架构设计和优化策略来实现时空建模,却忽视了关节之间的因果关系,导致模型可能过于精细化,从而在面对具有挑战性场景时估计不佳。因此,拥有充分的因果推理能力,同时具备良好的模型可解释性,对实现可靠结果至关重要。本文我们首次从因果视角出发进行姿态估计,引入一种因果激发的多任务学习框架,包含两个阶段。在第一个阶段,我们尝试通过引入两个自监督辅助任务来赋予模型因果时空建模能力。具体而言,这些辅助任务使网络能够基于观察到的关节信息推断具有挑战性的关键点,从而将因果推理能力内化于模型中,使其对具有挑战性场景更具鲁棒性。在第二个阶段,我们认为并非所有特征标记对姿态估计都同等重要。优先考虑因果(关键点相关)标记至关重要,以实现可靠的结果,这可能提高模型的可解释性。为此,我们提出了 Token 因果重要性选择模块,以识别因果标记和非因果标记(例如背景和物体)。此外,非因果标记可能提供潜在有益线索,但可能是冗余的。我们进一步引入非因果标记聚类模块以合并相似的非因果标记。大量实验表明,我们的方法在三个大规模基准数据集上超越了最先进的方法。

关键词

引用

@article{arxiv.2501.14356,
  title  = {Causal-Inspired Multitask Learning for Video-Based Human Pose Estimation},
  author = {Haipeng Chen and Sifan Wu and Zhigang Wang and Yifang Yin and Yingying Jiao and Yingda Lyu and Zhenguang Liu},
  journal= {arXiv preprint arXiv:2501.14356},
  year   = {2025}
}

备注

9 pages, 3 figures