基于动作捕捉引导的数据增强用于野外三维姿态估计
计算机视觉与模式识别
2016-10-31 v2
摘要
本文解决野外三维人体姿态估计问题。一个重大挑战是缺乏训练数据,即带有三维姿态标注的二维人体图像。此类数据对于训练最先进的卷积神经网络架构必不可少。在此,我们提出一种生成大量带有三维姿态标注的逼真合成人体图像的解决方案。我们引入一个基于图像的合成引擎,该引擎利用三维动作捕捉数据,人工增强带有二维人体姿态标注的真实图像数据集。给定一个候选三维姿态,我们的算法为每个关节选择一幅其二维姿态与投影三维姿态局部匹配的图像。然后,通过以运动学约束的方式拼接局部图像块,将所选图像组合生成新的合成图像。生成的图像用于训练一个端到端的全身体三维姿态估计卷积神经网络。我们将训练数据聚类为大量姿态类别,并将姿态估计处理为一个K路分类问题。这种方法仅在拥有像我们这样的大型训练集时才可行。我们的方法在受控环境(Human3.6M)下的三维姿态估计方面优于现有技术,并在野外图像(LSP)上显示出有前景的结果。这表明在人工图像上训练的卷积神经网络能很好地泛化到真实图像。
引用
@article{arxiv.1607.02046,
title = {MoCap-guided Data Augmentation for 3D Pose Estimation in the Wild},
author = {Grégory Rogez and Cordelia Schmid},
journal= {arXiv preprint arXiv:1607.02046},
year = {2016}
}
备注
9 pages, accepted to appear in NIPS 2016