中文

面向自然场景的单目三维人体姿态估计泛化方法

计算机视觉与模式识别 2019-04-12 v1

摘要

Human3.6M 数据集中大规模带标注的三维姿态对于推动从静态图像进行三维人体姿态估计的算法发展起着重要作用。我们观察到,该领域近期的创新主要集中于在使用此数据集时显式解决泛化问题的新技术,因为该数据库构建于高度受控的环境中,且人体主体与背景变化有限。尽管有此类努力,我们仍可以表明当前方法的结果容易出错,尤其是在针对自然场景(in-the-wild)拍摄的图像进行测试时。在本文中,我们旨在从不同的角度解决该问题。我们提出一种原则性方法,针对任意包含人物的自然场景图像生成高质量的三维姿态真值。为此,我们首先设计一种新颖的受立体视觉启发的神经网络,将任意二维姿态直接映射为高质量的三维对应姿态;随后执行精心设计的几何搜索方案以进一步细化关节点。基于该方案,我们构建了一个包含 400,000 张自然场景图像及其对应三维姿态真值的大规模数据集。这使得我们能够在无需专门训练方案和辅助损失函数的情况下,训练出高质量神经网络模型,其性能优于当前最先进(state-of-the-art)的三维姿态估计方法。我们还从定量和定性两方面评估了模型的泛化能力。结果表明,我们的方法令人信服地优于先前的方法。我们公开了数据集与代码。

关键词

引用

@article{arxiv.1904.05512,
  title  = {Generalizing Monocular 3D Human Pose Estimation in the Wild},
  author = {Luyang Wang and Yan Chen and Zhenhua Guo and Keyuan Qian and Mude Lin and Hongsheng Li and Jimmy S. Ren},
  journal= {arXiv preprint arXiv:1904.05512},
  year   = {2019}
}