中文

H$_{2}$OT:用于高效视频姿态 Transformer 的分层沙漏分词器

计算机视觉与模式识别 2025-09-09 v1 人工智能 机器学习

摘要

Transformer 已成功应用于基于视频的 3D 人体姿态估计领域。然而,这些视频姿态 Transformer(VPTs)的高计算成本使其在资源受限的设备上不切实际。本文提出一种分层的即插即用剪枝与恢复框架,称为分层沙漏分词器(H2_{2}OT),用于从视频中高效进行基于 Transformer 的 3D 人体姿态估计。H2_{2}OT 首先逐步剪枝冗余帧的姿态 Token,最后恢复全长序列,从而在中间 Transformer 块中仅保留少量姿态 Token,进而提高模型效率。它包含两个关键模块,即 Token 剪枝模块(TPM)和 Token 恢复模块(TRM)。TPM 动态选择少量代表性 Token 以消除视频帧的冗余,而 TRM 基于所选 Token 恢复详细的时空信息,从而将网络输出扩展至原始全长的时间分辨率以实现快速推理。我们的方法是通用的:它可以轻松集成到 seq2seq 和 seq2frame 流程的常见 VPT 模型中,同时有效适应不同的 Token 剪枝和恢复策略。此外,我们的 H2_{2}OT 表明,保持完整姿态序列是不必要的,少量代表性帧的姿态 Token 即可同时实现高效率和估计精度。在多个基准数据集上的广泛实验证明了所提方法的有效性和效率。代码和模型可在 https://github.com/NationalGAILab/HoT 获取。

关键词

引用

@article{arxiv.2509.06956,
  title  = {H$_{2}$OT: Hierarchical Hourglass Tokenizer for Efficient Video Pose Transformers},
  author = {Wenhao Li and Mengyuan Liu and Hong Liu and Pichao Wang and Shijian Lu and Nicu Sebe},
  journal= {arXiv preprint arXiv:2509.06956},
  year   = {2025}
}

备注

Accepted by TPAMI 2025, Open Sourced. arXiv admin note: substantial text overlap with arXiv:2311.12028