中文

VIBE:用于人体姿态与形状估计的视频推理

计算机视觉与模式识别 2020-05-01 v3

摘要

人体运动对于理解行为至关重要。尽管在单图像 3D 姿态与形状估计方面取得了进展,现有的基于视频的最先进方法由于缺乏用于训练的地面真实 3D 运动数据,无法产生准确而自然的动作序列。为解决该问题,我们提出用于人体姿态与形状估计的视频推理(VIBE),其利用了现有大规模动作捕捉数据集(AMASS)以及不成对的、真实场景中的 2D 关键点标注。我们的关键创新是一个对抗学习框架,利用 AMASS 来区分真实人体运动与我们时序姿态和形状回归网络所产生的运动。我们定义了时序网络架构,并表明在序列层级上的对抗训练可在无需真实场景地面真实 3D 标签的情况下产生运动学上合理的运动序列。我们进行了大量实验以分析运动的重要性,并证明 VIBE 在具有挑战性的 3D 姿态估计数据集上的有效性,取得了最先进的性能。代码与预训练模型可在 https://github.com/mkocabas/VIBE 获取。

关键词

引用

@article{arxiv.1912.05656,
  title  = {VIBE: Video Inference for Human Body Pose and Shape Estimation},
  author = {Muhammed Kocabas and Nikos Athanasiou and Michael J. Black},
  journal= {arXiv preprint arXiv:1912.05656},
  year   = {2020}
}

备注

CVPR-2020 camera ready. Code is available at https://github.com/mkocabas/VIBE