从多视角图像中学习单目 3D 人体姿态估计
计算机视觉与模式识别
2018-03-28 v2
摘要
借助已在非常大规模数据集上训练过的复杂深度网络架构,从单张图像中准确估计 3D 人体姿态是可行的。然而,对于不存在此类数据库的动捕问题,这仍然悬而未决。人工标注繁琐、缓慢且易出错。在本文中,我们提出仅在训练时利用多视角来替代大部分标注。具体而言,我们训练系统在所有视角中预测相同的姿态。这样的一致性约束是预测准确姿态的必要但不充分条件。因此我们辅以一个监督损失,旨在在一小组带标签图像中预测正确姿态,以及一个对初始预测漂移进行惩罚的正则化项。此外,我们提出一种联合估计相机姿态与人体姿态的方法,这使我们能够利用难以标定的多视角素材,例如平移-倾斜或移动手持相机。我们在已有基准以及一个带有旋转相机和专家滑雪动作、标注极难获取的新 Ski 数据集上证明了我们方法的有效性。
引用
@article{arxiv.1803.04775,
title = {Learning Monocular 3D Human Pose Estimation from Multi-view Images},
author = {Helge Rhodin and Jörg Spörri and Isinsu Katircioglu and Victor Constantin and Frédéric Meyer and Erich Müller and Mathieu Salzmann and Pascal Fua},
journal= {arXiv preprint arXiv:1803.04775},
year = {2018}
}
备注
CVPR 2018, Ski-Pose PTZ-Camera Dataset available