中文

STAR-Pose:基于时空自适应超分辨率的低分辨率视频人体姿态估计

计算机视觉与模式识别 2025-06-23 v1

摘要

低分辨率视频的人体姿态估计是计算机视觉中的一个根本性挑战。现有方法要么假设高质量的输入,要么采用计算昂贵的级联处理,这限制了其在资源受限环境中的部署。我们提出了STAR-Pose,一种专为视频人体姿态估计设计的时空自适应超分辨率框架。该方法包含一种新颖的时空Transformer,采用LeakyReLU修改后的线性注意力,高效地捕获长程时序依赖性。此外,它配备了一个自适应融合模块,用于集成平行的CNN分支以实现局部纹理增强。我们还设计了一种姿态感知复合损失,以实现任务导向的超分辨率。该损失引导网络重构对关键点定位最有利的结构特征,而非仅优化视觉质量。在多个主流视频姿态估计数据集上进行的大量实验表明,STAR-Pose优于现有方法。在极端低分辨率(64x48)条件下,实现了最高5.2%的mAP提升,同时比级联方法快2.8倍至4.4倍。

关键词

引用

@article{arxiv.2506.16061,
  title  = {STAR-Pose: Efficient Low-Resolution Video Human Pose Estimation via Spatial-Temporal Adaptive Super-Resolution},
  author = {Yucheng Jin and Jinyan Chen and Ziyue He and Baojun Han and Furan An},
  journal= {arXiv preprint arXiv:2506.16061},
  year   = {2025}
}

备注

14pages 3figures, alredy submiss to PRCV 2025