中文

注意力汇 sink在语言模型中何时出现:一个经验视角

计算与语言 2025-03-04 v2 人工智能 机器学习

摘要

语言模型(LMs)会对第一个token赋予显著的注意力,即使该token在语义上并不重要,这已为注意力汇 sink(attention sink)所知。这种现象被广泛应用于流式/长上下文生成、KV缓存优化、推理加速、模型量化等。尽管其应用广泛,但对注意力汇 sink在语言模型中的深入理解仍存缺失。本文首先演示了注意力汇 sink在各种输入下对语言模型都普遍存在,即使在小型模型中亦如此。进一步地,我们观察到注意力汇 sink在LM预训练期间出现,这促使我们研究优化、数据分布、损失函数和模型架构如何影响其出现。我们指出,注意力汇 sink是在对充足训练数据的有效优化之后出现的。sink位置与损失函数和数据分布高度相关。最重要的是,我们发现注意力汇 sink更像是key偏置,存储额外的注意力得分,这些得分可能是非信息性的且不 contribute to value computation。我们还观察到,这一现象(至少部分上)源于token对注意力得分的内在依赖,作为softmax归一化的结果。通过替换softmax注意力等其他注意力操作(如无归一化的sigmoid注意力),在达到10亿参数规模时,注意力汇 sink仍未在语言模型中出现。代码可在 https://github.com/sail-sg/Attention-Sink 获取。

关键词

引用

@article{arxiv.2410.10781,
  title  = {When Attention Sink Emerges in Language Models: An Empirical View},
  author = {Xiangming Gu and Tianyu Pang and Chao Du and Qian Liu and Fengzhuo Zhang and Cunxiao Du and Ye Wang and Min Lin},
  journal= {arXiv preprint arXiv:2410.10781},
  year   = {2025}
}

备注

ICLR 2025 (Spotlight)