中文

用于人体姿态估计的深度双重连续网络

计算机视觉与模式识别 2021-03-22 v3

摘要

复杂场景下的多帧人体姿态估计具有挑战性。尽管最先进的人体关节检测器在静态图像上已取得显著效果,但将这些模型应用于视频序列时性能不足。常见缺陷包括无法处理运动模糊、视频散焦或姿态遮挡,这源于难以捕捉视频帧间的时间依赖性。另一方面,直接采用传统循环神经网络在建模空间上下文时面临经验性困难,尤其在处理姿态遮挡时。本文提出一种新颖的多帧人体姿态估计框架,利用视频帧间丰富的时序线索来促进关键点检测。我们的框架设计了三个模块化组件。Pose Temporal Merger 编码关键点时空上下文以生成有效搜索范围,而 Pose Residual Fusion 模块计算双向加权姿态残差。随后通过我们的 Pose Correction Network 对这些进行处理,以高效细化姿态估计。我们的方法在大规模基准数据集 PoseTrack2017 和 PoseTrack2018 的多帧人体姿态估计挑战赛中排名第一。我们已发布代码,希望能启发未来研究。

关键词

引用

@article{arxiv.2103.07254,
  title  = {Deep Dual Consecutive Network for Human Pose Estimation},
  author = {Zhenguang Liu and Haoming Chen and Runyang Feng and Shuang Wu and Shouling Ji and Bailin Yang and Xun Wang},
  journal= {arXiv preprint arXiv:2103.07254},
  year   = {2021}
}

备注

This paper is accepted by CVPR 2021