理解大型语言模型中巨型激活的单层网络
计算与语言
2026-05-14 v2
摘要
我们探讨了大型语言模型(LLM)中巨型激活的来源, 并识别出一种名为巨型涌现层(ME Layer)的特定层, 其在多个模型家族中均一致观察到, 且巨型激活首先出现并随后通过残差连接向更深层传播。我们展示, 在 ME Layer 中, RMSNorm 和 FFN 参数共同致使巨型激活的出现。一旦形成, 巨型激活 token 表示在各层中基本保持不变, 减少了传递给注意力模块的隐藏表示的多样性。为了克服这一限制, 我们提出了一种简单有效的方法来降低巨型激活 token 的刚性。我们的做法在训练自由和微调设置下的多个任务中均一致改善了 LLM 的性能, 包括指令遵循和数学推理。此外, 我们表明我们的方法通过选择性削弱注意力 sink 的影响来缓解注意力 sink, 揭示了其在隐藏状态层面的起源, 为原则性缓解策略提供了新视角。
引用
@article{arxiv.2605.08504,
title = {A Single Layer to Explain Them All:Understanding Massive Activations in Large Language Models},
author = {Zeru Shi and Zhenting Wang and Fan Yang and Qifan Wang and Ruixiang Tang},
journal= {arXiv preprint arXiv:2605.08504},
year = {2026}
}