中文

基于多准则令牌融合与前瞻注意力的高效视觉 Transformer

计算机视觉与模式识别 2024-04-02 v3

摘要

视觉 Transformer 已成为计算机视觉领域的重要骨干网络。为了获得更高效的视觉 Transformer,近期的工作通过剪枝或融合冗余令牌来降低自注意力层的二次方成本。然而,这些工作面临着由信息丢失引起的速度-精度权衡问题。本文认为,令牌融合需要考虑令牌之间的多种关系以最小化信息损失。我们提出了一种多准则令牌融合方法,该方法基于多准则(例如,相似性、信息量和融合令牌的大小)逐步融合令牌。此外,我们利用了前瞻注意力,这是一种改进的捕获令牌信息量的方法。通过使用令牌缩减一致性训练配备多准则令牌融合的模型,我们在图像分类任务上实现了最佳的速度-精度权衡。实验结果表明,多准则令牌融合在有无训练的情况下均持续优于先前的缩减方法。具体来说,配备多准则令牌融合的 DeiT-T 和 DeiT-S 在分别比基础模型提升性能(+0.5% 和 +0.3%)的同时,减少了约 44% 的 FLOPs。我们还展示了多准则令牌融合在各种视觉 Transformer 中的适用性,实现了至少 31% 的加速且无性能下降。代码可在 https://github.com/mlvlab/MCTF 获取。

关键词

引用

@article{arxiv.2403.10030,
  title  = {Multi-criteria Token Fusion with One-step-ahead Attention for Efficient Vision Transformers},
  author = {Sanghyeok Lee and Joonmyung Choi and Hyunwoo J. Kim},
  journal= {arXiv preprint arXiv:2403.10030},
  year   = {2024}
}

备注

Conference on Computer Vision and Pattern Recognition (CVPR), 2024