中文

超越注意力令牌:融合令牌重要性与多样性以实现高效视觉 Transformer

计算机视觉与模式识别 2022-11-22 v1

摘要

视觉 Transformer 在各种视觉任务上取得了显著改进,但令牌之间的二次交互显著降低了计算效率。近来许多剪枝方法被提出以移除冗余令牌从而实现高效视觉 Transformer。然而,现有研究主要关注令牌重要性以保留局部注意力令牌,却完全忽略了全局令牌多样性。在本文中,我们强调多样化全局语义的关键性,并提出一种高效的令牌解耦与合并方法,能够联合考虑令牌重要性与多样性进行令牌剪枝。根据类令牌注意力,我们将注意力令牌与非注意力令牌解耦。除保留最具判别力的局部令牌外,我们合并相似的非注意力令牌并匹配同质的注意力令牌以最大化令牌多样性。尽管简单,我们的方法在模型复杂度和分类精度之间取得了良好的权衡。在 DeiT-S 上,我们的方法在仅损失 0.2% 精度的情况下将 FLOPs 降低了 35%。值得注意的是,得益于保持令牌多样性,我们的方法在将 DeiT-T 的 FLOPs 降低 40% 后甚至能将其精度提升 0.1%。

关键词

引用

@article{arxiv.2211.11315,
  title  = {Beyond Attentive Tokens: Incorporating Token Importance and Diversity for Efficient Vision Transformers},
  author = {Sifan Long and Zhen Zhao and Jimin Pi and Shengsheng Wang and Jingdong Wang},
  journal= {arXiv preprint arXiv:2211.11315},
  year   = {2022}
}