中文

面向 3D 人体姿态估计的仿真到真实迁移学习:运动来救场

计算机视觉与模式识别 2019-11-15 v2

摘要

合成视觉数据可提供实际上无限的多样性和丰富标注,同时避免隐私与偏见相关的伦理问题。然而,对于许多任务,当前在合成数据上训练的模型对真实数据泛化较差。3D 人体姿态估计任务便是这一 sim2real 问题尤其有趣的例子,因为基于学习的方法在给定真实训练数据时表现相当好,但在自然场景中标注 3D 姿态极难获取,限制了可扩展性。本文中,我们表明在合成 RGB 图像上训练时表现不佳的标准神经网络方法,当数据被预处理以提取关于人体运动的线索(显著如光流和 2D 关键点的运动)时可表现良好。因此,我们的结果表明,在可获得视频时,运动可以是弥合 sim2real 差距的一种简单方式。我们在 3D Poses in the Wild 数据集(最具挑战性的现代 3D 姿态估计基准)上评估,展示了完整的 3D 网格恢复,与在真实 3D 序列上训练的 SOTA 方法相当,尽管仅在来自 SURREAL 数据集的合成人体上训练。

关键词

引用

@article{arxiv.1907.02499,
  title  = {Sim2real transfer learning for 3D human pose estimation: motion to the rescue},
  author = {Carl Doersch and Andrew Zisserman},
  journal= {arXiv preprint arXiv:1907.02499},
  year   = {2019}
}

备注

Accepted at NeurIPS 2019