视频姿态估计的关节-运动互学习
计算机视觉与模式识别
2024-08-06 v1
摘要
视频中的人体姿态估计一直是计算机视觉领域中引人入胜但又具有挑战性的任务。然而,由于复杂的视频场景(如视频散焦和自遮挡),该任务仍然困难。近期方法致力于整合由骨干网络生成的多帧视觉特征用于姿态估计。然而,它们往往忽略了骨干网络生成过程中产生的有用关节信息(即初始热图)。相比之下,试图精化初始热图的方法未能考虑任何时空运动特征。因此,现有姿态估计方法的性能不足,原因在于缺乏同时利用局部关节(热图)信息和全局运动(特征)动态的能力。为解决这一问题,我们提出了一种新颖的关节-运动互学习框架,有效聚焦于局部关节依赖性和全局像素级运动动态。具体而言,我们引入了一种上下文感知的关节学习器,自适应地利用初始热图和运动流来检索鲁棒的局部关节特征。鉴于局部关节特征与全局运动流互补,我们进一步提出了渐进式关节-运动互学习,在关节特征与运动流之间协同交换信息并交互学习,以提升模型能力。更重要的是,为了捕获更多样化的关节和运动线索,我们在理论上分析并提出了一种信息正交目标,以避免从多线索中学习冗余信息。实验结果表明,我们的方法在三个具有挑战性的基准上优于先前方法。
引用
@article{arxiv.2408.02285,
title = {Joint-Motion Mutual Learning for Pose Estimation in Videos},
author = {Sifan Wu and Haipeng Chen and Yifang Yin and Sihao Hu and Runyang Feng and Yingying Jiao and Ziqi Yang and Zhenguang Liu},
journal= {arXiv preprint arXiv:2408.02285},
year = {2024}
}
备注
10 pages, 5 figures