用于基于视频的人体姿态估计的多粒度特征剪枝
计算机视觉与模式识别
2025-03-10 v1
摘要
人体姿态估计因其在动作识别和运动捕捉方面的广泛应用而取得了重大进展。然而,当前基于 Transformer 的视频姿态估计方法在处理冗余的时序信息和实现细粒度感知方面经常面临挑战,因为它们仅专注于处理低分辨率特征。为了应对这些挑战,我们提出了一种新颖的多尺度分辨率框架,该框架以不同的粒度编码时空表示并执行细粒度感知补偿。此外,我们采用密度峰值聚类方法来动态识别并优先处理提供重要语义信息的 token。该策略有效地剪枝了冗余的特征 token,特别是那些由多帧特征产生的 token,从而在不牺牲语义丰富度的前提下优化了计算效率。根据经验,该方法在三个大规模数据集上为性能和效率均设定了新的基准。与基线相比,我们的方法实现了 93.8% 的推理速度提升,同时也增强了姿态估计精度,在 PoseTrack2017 数据集上达到了 87.4 mAP。
引用
@article{arxiv.2503.05365,
title = {Multi-Grained Feature Pruning for Video-Based Human Pose Estimation},
author = {Zhigang Wang and Shaojing Fan and Zhenguang Liu and Zheqi Wu and Sifan Wu and Yingying Jiao},
journal= {arXiv preprint arXiv:2503.05365},
year = {2025}
}