中文

利用时间上下文进行无约束场景下的三维人体姿态估计

计算机视觉与模式识别 2019-05-13 v1

摘要

我们提出了一种基于光束法平差的算法,用于从单目视频中恢复精确的三维人体姿态与网格。与在单帧上运行的先前算法不同,我们表明在整段序列上重建一个人可提供额外的约束,从而解决歧义。这是因为视频常提供同一个人的多个视角,而整体身体形状不发生变化且三维位置缓慢变化。我们的方法不仅在 Human 3.6M 等基于 mocap 的标准数据集上有所改进——我们展示了定量提升——而且在 Kinetics 等具有挑战性的真实场景(in-the-wild)数据集上也表现更优。基于我们的算法,我们提出了一个包含来自 Kinetics 的超过 300 万帧 YouTube 视频的新数据集,其带有自动生成的三维姿态与网格。我们表明,通过在該数据上重新训练单帧三维姿态估计器,并在 3DPW 和 HumanEVA 数据集上评估,可提升其在真实世界与 mocap 数据上的准确性。

关键词

引用

@article{arxiv.1905.04266,
  title  = {Exploiting temporal context for 3D human pose estimation in the wild},
  author = {Anurag Arnab and Carl Doersch and Andrew Zisserman},
  journal= {arXiv preprint arXiv:1905.04266},
  year   = {2019}
}

备注

CVPR 2019