中文

带有联合Token与局部-全局注意力的Transformer用于高效人体姿态估计

计算机视觉与模式识别 2025-03-04 v1 机器学习

摘要

卷积神经网络(CNNs)和视觉Transformer(ViTs)在2D人体姿态估计方面取得了显著进展。然而,在准确性、效率和鲁棒性之间取得良好平衡仍然是一个挑战。例如,CNNs计算效率高但难以处理长程依赖,而ViTs在捕获此类依赖方面表现出色但面临二次计算复杂度。本文提出了两种基于ViT的模型,用于准确、高效和鲁棒的2D姿态估计。第一种模型EViTPose通过使用可学习的联合Token来选择和处理最重要的身体块子集,以计算高效的方式运行而不牺牲准确性,使我们能够通过改变要处理的块数量来控制准确性和效率之间的权衡。第二种模型UniTransPose虽然不允许相同级别的直接权衡控制,但通过结合(1)使用局部和全局注意力的有效多尺度Transformer编码器和(2)用于更好速度和准确性的高效子像素CNN解码器,高效地处理多个尺度。此外,通过将来自不同基准的所有关节整合到统一的骨骼表示中,我们训练了鲁棒的方法,能够同时从多个数据集学习,并在广泛场景中表现良好——包括姿态变化、光照条件和遮挡。在六个基准上的实验表明,所提出的方法显著优于最先进的方法,同时提高了计算效率。EViTPose在计算复杂度上显著降低(GFLOPs减少30%至44%),准确率下降最小(0%至3.5%),而UniTransPose在这些基准上的准确率提升范围为0.9%至43.8%。

关键词

引用

@article{arxiv.2503.00232,
  title  = {Transformers with Joint Tokens and Local-Global Attention for Efficient Human Pose Estimation},
  author = {Kaleab A. Kinfu and René Vidal},
  journal= {arXiv preprint arXiv:2503.00232},
  year   = {2025}
}

备注

This work has been submitted to the IEEE for possible publication