MonoCap:利用CNN与几何先验耦合的单目人体运动捕捉
计算机视觉与模式识别
2018-03-12 v2
摘要
恢复3D全身人体姿态是一个具有许多应用的挑战性问题。运动捕捉系统利用穿戴标记和多相机已成功解决。在本文中,我们解决更具挑战性的情况:不仅使用单相机而且不利用标记:直接从2D外观到3D几何。深度学习方法已展现出判别性学习2D外观特征的显著能力。缺失的一环是如何整合2D、3D和时间信息以恢复3D几何并解释判别模型产生的不确定性。我们引入一种新方法,将2D关节位置视为潜变量,其不确定性分布由深度全卷积神经网络给出。未知的3D姿态通过稀疏表示建模,3D参数估计通过期望最大化(Expectation-Maximization)算法实现,其中表明2D关节位置不确定性可在推断过程中方便地边缘化。在基准数据集上的广泛评估表明,所提方法比最先进的基线取得更高精度。值得注意的是,所提方法不需要同步的2D-3D数据用于训练,并且适用于“野外”图像,这通过MPII数据集得到证明。
引用
@article{arxiv.1701.02354,
title = {MonoCap: Monocular Human Motion Capture using a CNN Coupled with a Geometric Prior},
author = {Xiaowei Zhou and Menglong Zhu and Georgios Pavlakos and Spyridon Leonardos and Kostantinos G. Derpanis and Kostas Daniilidis},
journal= {arXiv preprint arXiv:1701.02354},
year = {2018}
}
备注
Accepted by PAMI. Extended version of the following paper: Sparseness Meets Deepness: 3D Human Pose Estimation from Monocular Video. X Zhou, M Zhu, S Leonardos, K Derpanis, K Daniilidis. CVPR 2016. arXiv admin note: substantial text overlap with arXiv:1511.09439