中文

人工注意力沉与注意力损伤:高效视觉 Transformer 的结构近似

计算机视觉与模式识别 2025-07-23 v1

摘要

视觉 Transformer 已成为广泛应用领域的强大工具,但其内部工作原理仍仅部分理解。在本工作中,我们检视大型标记 - 具有异常高激活范数且充当注意力沉的标记 - 以及推断过程中产生的注意力损伤标记的现象。我们的分析揭示,这些标记通过注意力机制相互抑制,从而在网络内部起关键作用,以调节信息流。利用这些见解,我们引入 Fast Nystr"om Attention (FNA),一种以线性时间和空间复杂度进行自注意力近似的训练自由方法,利用大型标记和注意力损伤标记形成的结构模式。此外,我们提出一种掩码策略以消除这些标记的噪声,获得 modest 的性能提升,几乎不增加计算开销。我们在流行的预训练视觉骨干网络上进行评估,展示在检索、分类、分割和视觉问答 (VQA) 等任务上均表现出竞争力,同时大幅降低计算开销。

关键词

引用

@article{arxiv.2507.16018,
  title  = {Artifacts and Attention Sinks: Structured Approximations for Efficient Vision Transformers},
  author = {Andrew Lu and Wentinn Liao and Liuhui Wang and Huzheng Yang and Jianbo Shi},
  journal= {arXiv preprint arXiv:2507.16018},
  year   = {2025}
}