中文

学习视频中三维姿态估计的动态人体关节亲和度

计算机视觉与模式识别 2021-09-16 v1

摘要

图卷积网络(GCN)已成功用于视频中的三维人体姿态估计。然而,它通常根据人体骨骼建立在固定的人体关节亲和度之上。这可能会降低GCN处理视频中复杂时空姿态变化的适应能力。为缓解该问题,我们提出了一种新颖的动态图网络(DG-Net),它能够动态识别人体关节亲和度,并通过从视频中自适应学习空间/时间关节关系来估计三维姿态。不同于传统图卷积,我们引入动态空间/时间图卷积(DSG/DTG),根据该视频中人体关节之间的空间距离/时间运动相似性,为每个视频样本发现空间/时间人体关节亲和度。因此,它们能有效理解哪些关节在空间上更近和/或具有一致运动,从而在将二维姿态提升为三维姿态时减少深度模糊和/或运动不确定性。我们在三个流行基准上进行了大量实验,例如Human3.6M、HumanEva-I和MPI-INF-3DHP,其中DG-Net以更少的输入帧数和模型尺寸优于许多近期SOTA方法。

关键词

引用

@article{arxiv.2109.07353,
  title  = {Learning Dynamical Human-Joint Affinity for 3D Pose Estimation in Videos},
  author = {Junhao Zhang and Yali Wang and Zhipeng Zhou and Tianyu Luan and Zhe Wang and Yu Qiao},
  journal= {arXiv preprint arXiv:2109.07353},
  year   = {2021}
}

备注

Accepted by IEEE Transactions on Image Processing