中文

在视觉Transformer的每个阶段你只需要更少的注意力

计算机视觉与模式识别 2024-06-04 v1

摘要

视觉Transformer(ViT)的出现标志着计算机视觉领域的重大范式转变。ViT通过自注意力模块捕获图像的全局信息,这些模块在分块后的图像令牌之间执行点积计算。虽然自注意力模块使ViT能够捕获长距离依赖关系,但计算复杂度随令牌数量呈二次方增长,这是ViT实际应用的主要障碍。此外,深层ViT中的自注意力机制也容易受到注意力饱和问题的影响。因此,我们认为没有必要在每一层都计算注意力分数,并提出了Less-Attention Vision Transformer(LaViT),它在每个阶段仅计算少量注意力操作,并在其他层中通过利用先前计算的注意力分数的注意力变换来计算后续的特征对齐。这种新颖的方法可以缓解困扰传统自注意力模块的两个主要问题:沉重的计算负担和注意力饱和。我们提出的架构具有卓越的效率和易于实现的特点,仅需要当代深度学习框架中高度优化的矩阵乘法。此外,我们的架构在包括分类、检测和分割在内的各种视觉任务中表现出卓越的性能。

关键词

引用

@article{arxiv.2406.00427,
  title  = {You Only Need Less Attention at Each Stage in Vision Transformers},
  author = {Shuoxi Zhang and Hanpeng Liu and Stephen Lin and Kun He},
  journal= {arXiv preprint arXiv:2406.00427},
  year   = {2024}
}

备注

CVPR 2024 Camera-Ready; 10 pages, 3 figures