中文

富有表现力的身体捕捉:从单张图像获取 3D 手部、面部和身体

计算机视觉与模式识别 2019-04-12 v1

摘要

为了便于分析人类动作、交互和情感,我们从单张单目图像计算人体姿态、手部姿态和面部表情的 3D 模型。为实现这一目标,我们使用数千个 3D 扫描来训练一个新的、统一的人体 3D 模型 SMPL-X,该模型通过完全铰接的手部和富有表现力的面部扩展了 SMPL。在没有配对图像和 3D 真值的情况下,直接从图像学习回归 SMPL-X 的参数具有挑战性。因此,我们遵循 SMPLify 的方法,先估计 2D 特征,然后优化模型参数以拟合这些特征。我们在几个重要方面对 SMPLify 进行了改进:(1) 我们检测对应于面部、手部和足部的 2D 特征,并将完整的 SMPL-X 模型拟合到这些特征上;(2) 我们使用大型 MoCap 数据集训练了一个新的神经网络姿态先验;(3) 我们定义了一种既快速又准确的新互穿惩罚;(4) 我们自动检测性别并选择合适的身体模型(男性、女性或中性);(5) 我们的 PyTorch 实现比 Chumpy 实现了 8 倍以上的加速。我们使用新方法 SMPLify-X 将 SMPL-X 拟合到受控图像和自然图像上。我们在一个包含 100 张带有伪真值的图像的精选新数据集上评估了 3D 准确度。这是迈向从单目 RGB 数据自动捕捉富有表现力的人类的重要一步。模型、代码和数据已用于研究目的,可在 https://smpl-x.is.tue.mpg.de 获取。

关键词

引用

@article{arxiv.1904.05866,
  title  = {Expressive Body Capture: 3D Hands, Face, and Body from a Single Image},
  author = {Georgios Pavlakos and Vasileios Choutas and Nima Ghorbani and Timo Bolkart and Ahmed A. A. Osman and Dimitrios Tzionas and Michael J. Black},
  journal= {arXiv preprint arXiv:1904.05866},
  year   = {2019}
}

备注

To appear in CVPR 2019