中文

通过补丁选择实现高效的人体姿态估计视觉 Transformer

计算机视觉与模式识别 2023-11-23 v2 机器学习

摘要

尽管卷积神经网络(CNNs)在 2D 人体姿态估计中已取得广泛成功,视觉 Transformer(ViTs)已成为 CNNs 的一种有前景的替代方案,提升了最先进性能。然而,ViTs 的二次计算复杂度限制了其处理高分辨率图像的适用性。在本文中,我们提出三种降低 ViT 计算复杂度的方法,它们基于选择并处理少量信息量最大的补丁而忽略其余补丁。前两种方法利用轻量级姿态估计网络来引导补丁选择过程,而第三种方法使用一组可学习的关节 token 来确保所选补丁包含关于身体关节的最重要信息。在六个基准上的实验表明,我们提出的方法实现了 30% 至 44% 的计算复杂度显著下降,而准确率仅微小下降 0% 至 3.5%。

关键词

引用

@article{arxiv.2306.04225,
  title  = {Efficient Vision Transformer for Human Pose Estimation via Patch Selection},
  author = {Kaleab A. Kinfu and Rene Vidal},
  journal= {arXiv preprint arXiv:2306.04225},
  year   = {2023}
}

备注

BMVC 2023 Oral Paper: https://proceedings.bmvc2023.org/167/