基于关系的关联关节定位用于视频中的人体姿态估计
计算机视觉与模式识别
2023-07-03 v3
摘要
基于视频的人体姿态估计(VHPE)是一项重要且具有挑战性的任务。尽管深度学习方法在VHPE上已取得显著进展,但该任务的大多数方法通过扩大卷积的感受野来隐式建模关节间的长程交互。与先前方法不同,我们设计了一个轻量且即插即用的关节关系提取器(JRE),以显式且自动地建模关节之间的关联关系。JRE以关节的伪热图作为输入并计算伪热图之间的相似度。通过这种方式,JRE灵活地学习任意两个关节之间的关系,使其能够学习人体姿态丰富的空间构型。此外,JRE可根据关节间的关系推断不可见关节,这有助于模型定位被遮挡的关节。接着,结合时间语义连续性建模,我们提出了一种基于关系的姿态语义传递网络(RPSTN)用于基于视频的人体姿态估计。具体而言,为捕捉姿态的时间动态,当前帧的姿态语义信息通过关节关系引导的姿态语义传播器(JRPSP)传递至下一帧。所提模型可将姿态语义特征从非遮挡帧传递至遮挡帧,使我们的方法对遮挡具有鲁棒性。此外,所提JRE模块也适用于基于图像的人体姿态估计。所提RPSTN在基于视频的Penn Action数据集、Sub-JHMDB数据集和PoseTrack2018数据集上取得了SOTA结果。而且,所提JRE在基于图像的COCO2017数据集上提升了骨干网络的性能。代码见https://github.com/YHDang/pose-estimation。
引用
@article{arxiv.2107.03591,
title = {Relation-Based Associative Joint Location for Human Pose Estimation in Videos},
author = {Yonghao Dang and Jianqin Yin and Shaojie Zhang},
journal= {arXiv preprint arXiv:2107.03591},
year = {2023}
}