中文

OTPose:面向稀疏标注视频中姿态估计的遮挡感知Transformer

计算机视觉与模式识别 2022-07-29 v2

摘要

尽管许多视频中多人姿态估计的方法已展现出深刻的结果,但它们需要密集标注数据,这带来了过多的人力劳动。此外,存在遮挡和运动模糊,不可避免地导致估计性能不佳。为解决这些问题,我们提出一种方法,利用针对被遮挡关节的注意力掩码,并使用Transformer编码帧间时间依赖关系。首先,我们的框架组合不同的稀疏标注帧,以表示整体关节运动的轨迹。我们从这些组合中提出一种遮挡注意力掩码,能够将编码遮挡感知热图作为半监督任务。其次,所提出的时间编码器采用Transformer架构,以有效聚合来自每个时间步的时间关系和关键点级注意力,并精确细化目标帧的最终姿态估计。我们在PoseTrack2017和PoseTrack2018数据集上取得了最先进的姿态估计结果,并证明了我们的方法对稀疏标注视频数据中的遮挡和运动模糊具有鲁棒性。

关键词

引用

@article{arxiv.2207.09725,
  title  = {OTPose: Occlusion-Aware Transformer for Pose Estimation in Sparsely-Labeled Videos},
  author = {Kyung-Min Jin and Gun-Hee Lee and Seong-Whan Lee},
  journal= {arXiv preprint arXiv:2207.09725},
  year   = {2022}
}

备注

6 pages