用于视频中多人姿态估计与跟踪的自监督关键点对应方法
计算机视觉与模式识别
2021-03-16 v3
摘要
视频标注昂贵且耗时。因此,相较于大规模人体姿态估计图像数据集,用于多人姿态估计与跟踪的数据集多样性较低且标注更稀疏。这使得学习基于深度学习的跨帧关键点关联模型变得困难,难以对多人姿态跟踪任务中的运动模糊和遮挡等干扰因素具有鲁棒性。为解决此问题,我们提出一种依赖关键点对应来关联视频中人物的方案。该网络不在视频数据上训练估计关键点对应,而是利用自监督在大规模人体姿态估计图像数据集上训练。结合自顶向下的人体姿态估计框架,我们利用关键点对应来(i)恢复漏检的姿态,(ii)关联视频帧间的姿态检测。我们的方法在 PosTrack 和 PoseTrack 数据集上取得了多人帧间姿态估计与多人姿态跟踪的最先进结果。
引用
@article{arxiv.2004.12652,
title = {Self-supervised Keypoint Correspondences for Multi-Person Pose Estimation and Tracking in Videos},
author = {Umer Rafi and Andreas Doering and Bastian Leibe and Juergen Gall},
journal= {arXiv preprint arXiv:2004.12652},
year = {2021}
}
备注
Accepted to ECCV 2020