中文

合成训练图像以增强人体三维姿态估计

计算机视觉与模式识别 2017-01-06 v6

摘要

从单幅图像进行人体三维姿态估计是一项具有众多应用的挑战性任务。卷积神经网络(CNNs)近期通过在众包收集的带二维标注的图像上训练,在单幅图像二维姿态估计任务上取得了优越性能。这表明直接估计三维姿态也可能取得类似成功。然而,三维姿态标注困难得多,且缺乏合适的标注训练图像阻碍了端到端解决方案的尝试。为解决此问题,我们选择自动合成带有真实姿态标注的训练图像。我们的工作是沿此方向的一项系统性研究。我们发现姿态空间覆盖度和纹理多样性是合成训练数据有效性的关键要素。我们提出一种全自动、可扩展的方法,该方法采样人体姿态空间以指导合成过程,并从真实图像中提取服装纹理。此外,我们探索域适应以弥合合成训练图像与真实测试照片之间的差距。我们证明,用我们的合成图像训练的CNN在三维姿态估计任务上优于用真实照片训练的CNN。

关键词

引用

@article{arxiv.1604.02703,
  title  = {Synthesizing Training Images for Boosting Human 3D Pose Estimation},
  author = {Wenzheng Chen and Huan Wang and Yangyan Li and Hao Su and Zhenhua Wang and Changhe Tu and Dani Lischinski and Daniel Cohen-Or and Baoquan Chen},
  journal= {arXiv preprint arXiv:1604.02703},
  year   = {2017}
}