中文

用于稀疏标注视频的人体姿态估计的时空动态学习

计算机视觉与模式识别 2025-01-28 v1

摘要

人体姿态估计在视频中的工作仍然具有挑战性,主要由于依赖大量手动标注数据的成本高昂且费时。此外,现有方法往往难以捕捉长程时序依赖,忽略了时序姿态热图与视觉特征之间的互补关系。为此,我们引入 STDPose,一个新型框架,通过学习稀疏标注视频中的时空动态来增强人体姿态估计。STDPose 包含两个关键创新:1) 一种新型的动态感知掩码,用于捕捉长程运动上下文,实现对姿态变化的细致理解。2) 一种用于编码和聚合时空表征与运动动态的系统,有效建模时空关系,提高姿态估计的准确性和鲁棒性。STDPose 在三个大规模评估数据集上建立了视频姿态传递(即将标记帧的姿态标注传递到未标记帧)和姿态估计任务的新基准。此外,利用姿态传递生成的伪标签,STDPose 只需 26.7% 的标注数据即可实现竞争性能。

关键词

引用

@article{arxiv.2501.15073,
  title  = {SpatioTemporal Learning for Human Pose Estimation in Sparsely-Labeled Videos},
  author = {Yingying Jiao and Zhigang Wang and Sifan Wu and Shaojing Fan and Zhenguang Liu and Zhuoyue Xu and Zheqi Wu},
  journal= {arXiv preprint arXiv:2501.15073},
  year   = {2025}
}