HEViTPose:用于人体姿态估计的高效视觉Transformer
计算机视觉与模式识别
2023-11-27 v1
摘要
复杂场景下的人体姿态估计一直是一项具有挑战性的任务。近来许多基于Transformer的姿态网络被提出,在提升性能方面取得了令人鼓舞的进展。然而,姿态网络的卓越性能总是伴随着沉重的计算成本与庞大的网络规模。为应对此问题,本文提出一种用于人体姿态估计的高效视觉Transformer(High-Efficiency Vision Transformer for Human Pose Estimation, HEViTPose)。在HEViTPose中,提出了级联分组空间缩减多头注意力模块(Cascaded Group Spatial Reduction Multi-Head Attention Module, CGSR-MHA),其通过特征分组与空间退化机制降低计算成本,同时通过多个低维注意力头保持特征多样性。此外,定义了块嵌入重叠宽度(Patch Embedded Overlap Width, PEOW)的概念,以帮助理解重叠量与局部连续性之间的关系。通过优化PEOW,我们的模型在性能、参数量和GFLOPs上均获得改进。在两个基准数据集(MPII和COCO)上的综合实验表明,HEViTPose的小型和大型模型在更轻量的同时与最先进模型相当。具体而言,HEViTPose-B在MPII测试集上达到90.7 [email protected],在COCO test-dev2017集上达到72.6 AP。与HRNet-W32和Swin-S相比,我们的HEViTPose-B显著减少了参数(62.1%,80.4%)和GFLOPs(43.4%,63.8%)。代码和模型可在\url{here}获取。
引用
@article{arxiv.2311.13615,
title = {HEViTPose: High-Efficiency Vision Transformer for Human Pose Estimation},
author = {Chengpeng Wu and Guangxing Tan and Chunyu Li},
journal= {arXiv preprint arXiv:2311.13615},
year = {2023}
}