中文

Detect-and-Track:视频中高效的人体姿态估计

计算机视觉与模式识别 2018-05-04 v2

摘要

本文解决复杂多人视频中人体关键点估计与跟踪的问题。我们提出一种极轻量却十分有效的方法,该方法建立在人体检测与视频理解最新进展之上。我们的方法分两阶段运行:在帧或短片段中进行关键点估计,随后进行轻量跟踪以生成关联至整个视频的关键点预测。对于帧级姿态估计,我们实验了 Mask R-CNN,以及我们自身提出的该模型的三维扩展,其利用小片段上的时间信息生成更鲁棒的帧预测。我们在新发布的多人视频姿态估计基准 PoseTrack 上进行广泛的消融实验,以验证模型的多种设计选择。我们的方法在验证集上以多目标跟踪准确率(MOTA)指标取得 55.2% 的准确率,在测试集上取得 51.8%,并在 ICCV 2017 PoseTrack 关键点跟踪挑战赛上取得最先进的性能。

关键词

引用

@article{arxiv.1712.09184,
  title  = {Detect-and-Track: Efficient Pose Estimation in Videos},
  author = {Rohit Girdhar and Georgia Gkioxari and Lorenzo Torresani and Manohar Paluri and Du Tran},
  journal= {arXiv preprint arXiv:1712.09184},
  year   = {2018}
}

备注

In CVPR 2018. Ranked first in ICCV 2017 PoseTrack challenge (keypoint tracking in videos). Code: https://github.com/facebookresearch/DetectAndTrack and webpage: https://rohitgirdhar.github.io/DetectAndTrack/