中文

学习精化人体姿态估计

计算机视觉与模式识别 2018-04-24 v1

摘要

图像与视频中的多人姿态估计是一项重要却具挑战性的任务,有着诸多应用。尽管卷积神经网络的发展使人体姿态估计取得巨大进步,仍存在大量困难情形,即便最先进的模型也未能正确定位所有身体关节。这催生了对一个额外精化步骤的需求,以处理这些挑战性情形,并能轻易应用于任何现有方法之上。本工作中,我们引入一个姿态精化网络(PoseRefiner),其以图像与给定姿态估计为输入,并通过联合推理输入输出空间来直接预测精化后的姿态。为使网络学会精化错误的身体关节预测,我们采用一种新颖的数据增强方案进行训练,其中我们对“困难”人体姿态情形建模。我们在四个流行的大规模姿态估计基准(如 MPII 单人及多人姿态估计、PoseTrack 姿态估计与 PoseTrack 姿态跟踪)上评估我们的方法,并报告了相对于最先进方法的系统性提升。

关键词

引用

@article{arxiv.1804.07909,
  title  = {Learning to Refine Human Pose Estimation},
  author = {Mihai Fieraru and Anna Khoreva and Leonid Pishchulin and Bernt Schiele},
  journal= {arXiv preprint arXiv:1804.07909},
  year   = {2018}
}

备注

To appear in CVPRW (2018). Workshop: Visual Understanding of Humans in Crowd Scene and the 2nd Look Into Person Challenge (VUHCS-LIP)