大型语言模型中注意力沉底的形成:一种解释性视角
机器学习
2026-03-10 v1 计算与语言
摘要
大型语言模型(LLM)常常在特定token上分配不成比例的注意力,这种现象通常被称为注意力沉底。虽然这些沉底通常被视为有害的,但先前的研究识别出一个值得注意的例外:模型对输入序列第一个token持续强调的结构性偏差。这一现象可以影响广泛的下游应用,值得深入考虑。尽管这种现象广为人知,但注意力沉底的形成与持续机制仍鲜为人知。在本文中,我们追踪了围绕输入第一个token注意力沉底的形成过程。我们识别出一种称为P0注意力沉底电路的简单机制,使模型能够在两个Transformer模块内识别位置为零的token,无需依赖任何语义信息即可诱导注意力沉底。这一机制构成了位置零注意力沉底的基础。此外,通过分析在300亿参数A3B混合专家模型从头训练的训练轨迹,我们发现该机制在训练初期即出现,并在前两层中日益集中,这表明该机制可能是跟踪预训练收敛状态的信号。
关键词
引用
@article{arxiv.2603.06591,
title = {How Attention Sinks Emerge in Large Language Models: An Interpretability Perspective},
author = {Runyu Peng and Ruixiao Li and Mingshu Chen and Yunhua Zhou and Qipeng Guo and Xipeng Qiu},
journal= {arXiv preprint arXiv:2603.06591},
year = {2026}
}