用于人体姿态估计的深度双重连续网络
计算机视觉与模式识别
2021-03-22 v3
摘要
复杂场景下的多帧人体姿态估计具有挑战性。尽管最先进的人体关节检测器在静态图像上已取得显著效果,但将这些模型应用于视频序列时性能不足。常见缺陷包括无法处理运动模糊、视频散焦或姿态遮挡,这源于难以捕捉视频帧间的时间依赖性。另一方面,直接采用传统循环神经网络在建模空间上下文时面临经验性困难,尤其在处理姿态遮挡时。本文提出一种新颖的多帧人体姿态估计框架,利用视频帧间丰富的时序线索来促进关键点检测。我们的框架设计了三个模块化组件。Pose Temporal Merger 编码关键点时空上下文以生成有效搜索范围,而 Pose Residual Fusion 模块计算双向加权姿态残差。随后通过我们的 Pose Correction Network 对这些进行处理,以高效细化姿态估计。我们的方法在大规模基准数据集 PoseTrack2017 和 PoseTrack2018 的多帧人体姿态估计挑战赛中排名第一。我们已发布代码,希望能启发未来研究。
引用
@article{arxiv.2103.07254,
title = {Deep Dual Consecutive Network for Human Pose Estimation},
author = {Zhenguang Liu and Haoming Chen and Runyang Feng and Shuang Wu and Shouling Ji and Bailin Yang and Xun Wang},
journal= {arXiv preprint arXiv:2103.07254},
year = {2021}
}
备注
This paper is accepted by CVPR 2021