中文

面向自然场景的精确多人姿态估计

计算机视觉与模式识别 2017-04-18 v2

摘要

我们提出了一种多人检测与二维姿态估计方法,在具有挑战性的COCO关键点任务上取得了当前最优结果。该方法采用简单而强大的自顶向下两阶段策略。第一阶段,我们预测可能包含人的边界框的位置和尺度,为此使用Faster RCNN检测器。第二阶段,我们估计每个候选边界框内潜在人物的关键点。对于每种关键点类型,我们使用全卷积ResNet预测密集热图和偏移量。为组合这些输出,我们引入了一种新颖的聚合过程以获得高度局部化的关键点预测。我们还采用了一种新颖的基于关键点的非极大值抑制(NMS)形式,取代较粗糙的边界框级NMS,以及一种新颖的基于关键点的置信度估计形式,取代边界框级评分。仅使用COCO数据训练,我们的最终系统在COCO test-dev集上达到0.649的平均精度,在test-standard集上达到0.643,超越了2016年COCO关键点挑战赛的获胜者及其他近期最优方法。此外,通过使用额外的内部标注数据,我们在test-dev集上获得了更高的0.685平均精度,在test-standard集上达到0.673,相比同一数据集上此前表现最佳的方法,绝对提升超过5%。

关键词

引用

@article{arxiv.1701.01779,
  title  = {Towards Accurate Multi-person Pose Estimation in the Wild},
  author = {George Papandreou and Tyler Zhu and Nori Kanazawa and Alexander Toshev and Jonathan Tompson and Chris Bregler and Kevin Murphy},
  journal= {arXiv preprint arXiv:1701.01779},
  year   = {2017}
}

备注

Paper describing an improved version of the G-RMI entry to the 2016 COCO keypoints challenge (http://image-net.org/challenges/ilsvrc+coco2016). Camera ready version to appear in the Proceedings of CVPR 2017