学习视频中三维姿态估计的动态人体关节亲和度
计算机视觉与模式识别
2021-09-16 v1
摘要
图卷积网络(GCN)已成功用于视频中的三维人体姿态估计。然而,它通常根据人体骨骼建立在固定的人体关节亲和度之上。这可能会降低GCN处理视频中复杂时空姿态变化的适应能力。为缓解该问题,我们提出了一种新颖的动态图网络(DG-Net),它能够动态识别人体关节亲和度,并通过从视频中自适应学习空间/时间关节关系来估计三维姿态。不同于传统图卷积,我们引入动态空间/时间图卷积(DSG/DTG),根据该视频中人体关节之间的空间距离/时间运动相似性,为每个视频样本发现空间/时间人体关节亲和度。因此,它们能有效理解哪些关节在空间上更近和/或具有一致运动,从而在将二维姿态提升为三维姿态时减少深度模糊和/或运动不确定性。我们在三个流行基准上进行了大量实验,例如Human3.6M、HumanEva-I和MPI-INF-3DHP,其中DG-Net以更少的输入帧数和模型尺寸优于许多近期SOTA方法。
引用
@article{arxiv.2109.07353,
title = {Learning Dynamical Human-Joint Affinity for 3D Pose Estimation in Videos},
author = {Junhao Zhang and Yali Wang and Zhipeng Zhou and Tianyu Luan and Zhe Wang and Yu Qiao},
journal= {arXiv preprint arXiv:2109.07353},
year = {2021}
}
备注
Accepted by IEEE Transactions on Image Processing