中文

HEViTPose:用于人体姿态估计的高效视觉Transformer

计算机视觉与模式识别 2023-11-27 v1

摘要

复杂场景下的人体姿态估计一直是一项具有挑战性的任务。近来许多基于Transformer的姿态网络被提出,在提升性能方面取得了令人鼓舞的进展。然而,姿态网络的卓越性能总是伴随着沉重的计算成本与庞大的网络规模。为应对此问题,本文提出一种用于人体姿态估计的高效视觉Transformer(High-Efficiency Vision Transformer for Human Pose Estimation, HEViTPose)。在HEViTPose中,提出了级联分组空间缩减多头注意力模块(Cascaded Group Spatial Reduction Multi-Head Attention Module, CGSR-MHA),其通过特征分组与空间退化机制降低计算成本,同时通过多个低维注意力头保持特征多样性。此外,定义了块嵌入重叠宽度(Patch Embedded Overlap Width, PEOW)的概念,以帮助理解重叠量与局部连续性之间的关系。通过优化PEOW,我们的模型在性能、参数量和GFLOPs上均获得改进。在两个基准数据集(MPII和COCO)上的综合实验表明,HEViTPose的小型和大型模型在更轻量的同时与最先进模型相当。具体而言,HEViTPose-B在MPII测试集上达到90.7 [email protected],在COCO test-dev2017集上达到72.6 AP。与HRNet-W32和Swin-S相比,我们的HEViTPose-B显著减少了参数(\downarrow62.1%,\downarrow80.4%)和GFLOPs(\downarrow43.4%,\downarrow63.8%)。代码和模型可在\url{here}获取。

关键词

引用

@article{arxiv.2311.13615,
  title  = {HEViTPose: High-Efficiency Vision Transformer for Human Pose Estimation},
  author = {Chengpeng Wu and Guangxing Tan and Chunyu Li},
  journal= {arXiv preprint arXiv:2311.13615},
  year   = {2023}
}