用于高效基于 Transformer 的视频三维人体姿态估计的沙漏分词器
计算机视觉与模式识别
2024-03-28 v2 人工智能
机器学习
摘要
Transformer 已成功应用于基于视频的 3D 人体姿态估计领域。然而,这些视频姿态 Transformer(VPT)的高计算成本使它们在资源受限设备上不切实际。本文中,我们提出一种即插即用的剪枝-恢复框架,称为沙漏分词器(HoT),用于高效的基于 Transformer 的视频 3D 人体姿态估计。我们的 HoT 以对冗余帧的姿态 token 进行剪枝开始,以恢复全长 token 结束,从而在中间 Transformer 块中仅保留少量姿态 token,进而提升模型效率。为有效实现这一点,我们提出一种 token 剪枝簇(TPC),其动态选择少量具有高语义多样性的代表性 token,同时消除视频帧的冗余。此外,我们开发了 token 恢复注意力(TRA),基于所选 token 恢复详细的时空信息,从而将网络输出扩展到原始全长时间分辨率以实现快速推理。在两个基准数据集(即 Human3.6M 和 MPI-INF-3DHP)上的大量实验表明,与原 VPT 模型相比,我们的方法能同时实现高效率和估计精度。例如,在 Human3.6M 上应用于 MotionBERT 和 MixSTE 时,我们的 HoT 可分别节省近 50% FLOPs 而不损失精度,以及近 40% FLOPs 且仅 0.2% 精度下降。代码和模型可在 https://github.com/NationalGAILab/HoT 获取。
引用
@article{arxiv.2311.12028,
title = {Hourglass Tokenizer for Efficient Transformer-Based 3D Human Pose Estimation},
author = {Wenhao Li and Mengyuan Liu and Hong Liu and Pichao Wang and Jialun Cai and Nicu Sebe},
journal= {arXiv preprint arXiv:2311.12028},
year = {2024}
}
备注
Accepted by CVPR 2024, Open Sourced