用于单图像3D人体姿态的由粗到细体素预测
计算机视觉与模式识别
2017-07-27 v2
摘要
本文探讨了从单张彩色图像进行3D人体姿态估计的挑战。尽管端到端学习范式取得了普遍成功,但表现最佳的方法仍采用两步解决方案:包括用于2D关节定位的卷积网络(ConvNet)和随后用于恢复3D姿态的优化步骤。在本文中,我们将3D姿态的表示确定为当前ConvNet方法的一个关键问题,并做出了两项重要贡献,以验证端到端学习在此任务中的价值。首先,我们提出对主体周围的三维空间进行精细离散化,并训练ConvNet预测每个关节的每体素似然。这为3D姿态创建了一种自然的表示,并大大优于直接回归关节坐标的方法。其次,为了进一步改进初始估计,我们采用了由粗到细的预测方案。这一步骤解决了维度大幅增加的问题,并实现了对图像特征的迭代细化和重复处理。所提出的方法在标准基准上优于所有SOTA方法,平均相对误差降低超过30%。此外,我们研究了在相关架构中使用体素表示,虽然该架构与我们的端到端方法相比并非最优,但具有实际意义,因为它能够在没有对应3D真值的图像时进行训练,并允许我们针对野外图像展示令人信服的结果。
引用
@article{arxiv.1611.07828,
title = {Coarse-to-Fine Volumetric Prediction for Single-Image 3D Human Pose},
author = {Georgios Pavlakos and Xiaowei Zhou and Konstantinos G. Derpanis and Kostas Daniilidis},
journal= {arXiv preprint arXiv:1611.07828},
year = {2017}
}
备注
CVPR 2017 Camera Ready. Project Page: https://www.seas.upenn.edu/~pavlakos/projects/volumetric/