Transformer注意力槽:关于利用、解释与缓解的全面综述
机器学习
2026-04-14 v1
摘要
作为现代机器学习的基础架构,Transformer推动了人工智能领域取得的显著进展。尽管其产生了变革性影响,但在各种Transformer模型中仍存在持续的挑战,即注意力槽(Attention Sink, AS)——即注意力在特定且缺乏信息的少数token上所集中。AS complicate解释性,显著影响训练与推理动力学,加剧了幻觉等问题。近年来,大量研究致力于理解和利用AS,但目前缺乏一个系统性地整合AS相关研究并为未来发展提供指导的综述。为填补这一空白,我们呈现首个关于AS的综述,围绕三个关键维度构建:基本利用、机制解释与战略缓解。我们的工作通过澄清关键概念,引导研究者把握该领域的演进与趋势,提供了关键性贡献。我们设想这篇综述将成为研究者与实践者有效管理当前Transformer范式中AS的 definitive 资源,同时激发下一代Transformer的创新性进步。本论文的参考文献列表已公开于https://github.com/ZunhaiSu/Awesome-Attention-Sink。
关键词
引用
@article{arxiv.2604.10098,
title = {Attention Sink in Transformers: A Survey on Utilization, Interpretation, and Mitigation},
author = {Zunhai Su and Hengyuan Zhang and Wei Wu and Yifan Zhang and Yaxiu Liu and He Xiao and Qingyao Yang and Yuxuan Sun and Rui Yang and Chao Zhang and Keyu Fan and Weihao Ye and Jing Xiong and Hui Shen and Chaofan Tao and Taiqiang Wu and Zhongwei Wan and Yulei Qian and Yuchen Xie and Ngai Wong},
journal= {arXiv preprint arXiv:2604.10098},
year = {2026}
}