注意力汇的结构起源:方差差异、超级神经元与维度不匹配
机器学习
2026-05-08 v1 人工智能
机器学习
摘要
尽管注意力汇现象在大型语言模型(LLM)中普遍存在——即初始 token 不成比例地垄断了注意力分数——但其结构起源仍然难以捉摸。本工作为该现象提供了机制解释。首先,我们将其根源追溯至自注意力中固有的值聚合过程,该过程引发了系统性的方差差异。我们进一步表明,前馈网络(FFN)层中超级神经元的激活急剧放大了这一差异。具体而言,通道稀疏的下投影引发了首个 token 表示的维度不匹配,从而需要将注意力汇形成结构锚点。然后,我们通过两项受控干预验证了这一因果链: 通过注意力掩码修改隔离聚合效应; 放大目标 token 表示的方差。这两项干预均能在任意位置复现注意力汇。我们的机制理解为系统控制汇的形成提供了基础。最后,作为概念验证,我们提出了逐头 RMSNorm(head-wise RMSNorm),这是一种在预训练期间稳定值聚合输出的架构修改。我们的实验表明,恢复各位置间的统计平价显著加速了收敛。
引用
@article{arxiv.2605.06611,
title = {The Structural Origin of Attention Sink: Variance Discrepancy, Super Neurons, and Dimension Disparity},
author = {Siquan Li and Kaiqi Jiang and Jiacheng Sun and Tianyang Hu},
journal= {arXiv preprint arXiv:2605.06611},
year = {2026}
}
备注
Accepted to ICML 2026