通过聚焦人体与关节区域优化人体姿态估计
计算机视觉与模式识别
2025-01-27 v1
摘要
人体姿态估计已催生广泛的新型且引人入胜的应用,包括动作识别、体育分析及监控。然而,准确的视频姿态估计仍是开放挑战。目前方法关注点缺失:它们从所有像素中学习运动线索,而非聚焦于目标人体,导致易受背景变化或他人动作干扰。此外,虽然基于Transformer的姿态估计方法在全局建模方面表现卓越,但在局部上下文感知和精确位置识别方面仍受限。本文从三个方面尝试解决这些挑战:(1) 提出双层 Human-Keypoint 掩码模块,实现粗到细的视觉令牌细化,逐步聚焦于目标人体及关键点,同时屏蔽无关区域;(2) 引入新型可变形交叉注意力机制及双向分离策略,适应性地聚合受限周围环境的空间与时间运动线索;(3) 对可变形交叉注意力进行数学形式化,约束模型仅关注目标人体中心区域。实验表明,我们的方法在三个大规模基准数据集上实现了最先进的性能。值得注意的是,我们的方法在 PoseTrack2017 数据集上将难题关节的平均精度 (mAP) 提升至 84.8,显著优于当前最先进方法的 81.5。
引用
@article{arxiv.2501.14439,
title = {Optimizing Human Pose Estimation Through Focused Human and Joint Regions},
author = {Yingying Jiao and Zhigang Wang and Zhenguang Liu and Shaojing Fan and Sifan Wu and Zheqi Wu and Zhuoyue Xu},
journal= {arXiv preprint arXiv:2501.14439},
year = {2025}
}