GTPT:基于分组令牌剪枝的高效人体姿态估计Transformer
计算机视觉与模式识别
2024-07-17 v2
摘要
近年来,二维人体姿态估计在公共基准上取得了显著进展。然而,由于参数量和计算开销巨大,许多此类方法在工业界面临适用性较差的挑战。高效的人体姿态估计仍然是一个难题,尤其是对于具有众多关键点的全身姿态估计。虽然当前大多数高效人体姿态估计方法主要依赖CNN,但我们提出了基于分组令牌剪枝的Transformer(GTPT),它充分利用了Transformer的优势。GTPT通过以由粗到细的方式逐步引入关键点来减轻计算负担。它在确保高性能的同时最小化计算开销。此外,GTPT对关键点令牌进行分组并对视觉令牌进行剪枝,以提高模型性能并减少冗余。我们提出了不同组之间的多头分组注意力(MHGA),以极小的计算开销实现全局交互。我们在COCO和COCO-WholeBody上进行了实验。与其他方法相比,实验结果表明,GTPT可以用更少的计算量实现更高的性能,尤其是在具有众多关键点的全身姿态估计任务上。
引用
@article{arxiv.2407.10756,
title = {GTPT: Group-based Token Pruning Transformer for Efficient Human Pose Estimation},
author = {Haonan Wang and Jie Liu and Jie Tang and Gangshan Wu and Bo Xu and Yanbing Chou and Yong Wang},
journal= {arXiv preprint arXiv:2407.10756},
year = {2024}
}
备注
ECCV 2024 accepted