中文

利用多视图采集无标记三维人体姿态标注

计算机视觉与模式识别 2017-04-18 v1

摘要

卷积网络(ConvNets)的最新进展已将许多计算机视觉任务的瓶颈转移到标注数据收集上。本文中,我们提出一种几何驱动的方法,用于自动收集人体姿态预测任务的标注。从通用的二维人体姿态ConvNet出发,并假设多视图设置,我们描述了一种自动收集精确三维人体姿态标注的方法。我们利用相机设置的三维几何与人体三维结构所提供的约束,将各视图的二维ConvNet预测以概率方式组合为全局最优的三维姿态。此三维姿态用作采集标注的基础。我们通过两个具有挑战性的设置展示了以我们的方法自动产生的标注的益处:(i) 微调基于通用ConvNet的二维姿态预测器以捕获受试者外观的判别性方面(即“个性化”),以及 (ii) 从头训练ConvNet用于单视图三维人体姿态预测,而不利用三维姿态真值。所提出的多视图姿态估计器在标准基准上取得了最先进的成果,证明了我们的方法在利用可用多视图信息方面的有效性。

关键词

引用

@article{arxiv.1704.04793,
  title  = {Harvesting Multiple Views for Marker-less 3D Human Pose Annotations},
  author = {Georgios Pavlakos and Xiaowei Zhou and Konstantinos G. Derpanis and Kostas Daniilidis},
  journal= {arXiv preprint arXiv:1704.04793},
  year   = {2017}
}

备注

CVPR 2017 Camera Ready