中文

Skip-Attention:通过减少注意力投入改进视觉 Transformer

计算机视觉与模式识别 2023-01-18 v2

摘要

本工作旨在提升视觉 Transformer(ViT)的效率。尽管 ViT 在每一层都使用计算代价高昂的自注意力操作,我们发现这些操作在各层之间高度相关——这是一种导致不必要计算的关键冗余。基于该观察,我们提出 SkipAt,一种复用前层自注意力计算来近似后续一层或多层注意力的办法。为确保跨层复用自注意力块不降低性能,我们引入一个简单的参数化函数,其在计算速度更快的同时优于基线 Transformer 的性能。我们在 ImageNet-1K 上的图像分类与自监督学习、ADE20K 上的语义分割、SIDD 上的图像去噪以及 DAVIS 上的视频去噪中展示了方法的有效性。我们在所有这些任务中以相同或更优的精度水平实现了更高的吞吐量。

关键词

引用

@article{arxiv.2301.02240,
  title  = {Skip-Attention: Improving Vision Transformers by Paying Less Attention},
  author = {Shashanka Venkataramanan and Amir Ghodrati and Yuki M. Asano and Fatih Porikli and Amirhossein Habibian},
  journal= {arXiv preprint arXiv:2301.02240},
  year   = {2023}
}