H$_{2}$OT:用于高效视频姿态 Transformer 的分层沙漏分词器
计算机视觉与模式识别
2025-09-09 v1 人工智能
机器学习
摘要
Transformer 已成功应用于基于视频的 3D 人体姿态估计领域。然而,这些视频姿态 Transformer(VPTs)的高计算成本使其在资源受限的设备上不切实际。本文提出一种分层的即插即用剪枝与恢复框架,称为分层沙漏分词器(HOT),用于从视频中高效进行基于 Transformer 的 3D 人体姿态估计。HOT 首先逐步剪枝冗余帧的姿态 Token,最后恢复全长序列,从而在中间 Transformer 块中仅保留少量姿态 Token,进而提高模型效率。它包含两个关键模块,即 Token 剪枝模块(TPM)和 Token 恢复模块(TRM)。TPM 动态选择少量代表性 Token 以消除视频帧的冗余,而 TRM 基于所选 Token 恢复详细的时空信息,从而将网络输出扩展至原始全长的时间分辨率以实现快速推理。我们的方法是通用的:它可以轻松集成到 seq2seq 和 seq2frame 流程的常见 VPT 模型中,同时有效适应不同的 Token 剪枝和恢复策略。此外,我们的 HOT 表明,保持完整姿态序列是不必要的,少量代表性帧的姿态 Token 即可同时实现高效率和估计精度。在多个基准数据集上的广泛实验证明了所提方法的有效性和效率。代码和模型可在 https://github.com/NationalGAILab/HoT 获取。
引用
@article{arxiv.2509.06956,
title = {H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers},
author = {Wenhao Li and Mengyuan Liu and Hong Liu and Pichao Wang and Shijian Lu and Nicu Sebe},
journal= {arXiv preprint arXiv:2509.06956},
year = {2025}
}
备注
Accepted by TPAMI 2025, Open Sourced. arXiv admin note: substantial text overlap with arXiv:2311.12028