注意力汇沉与压缩谷是 LLM 中的两个面向同一硬币的现象
机器学习
2026-02-11 v2 人工智能
摘要
注意力汇沉与压缩谷已引起广泛关注作为大型语言模型中的两个谜样现象,但彼此独立研究。本文发现二者之间的惊人联系,将两者归因于残差流中巨大的激活值形成。我们从理论上证明巨大的激活值必然产生表征压缩并给出相应熵减少的界限。通过实验检验多个模型(参数规模410M至120B),我们确认当序列开头标记在中层开发极端激活范数时,压缩谷与注意力汇沉会同时出现。针对性消融研究验证了我们的理论预测。这一统一视角促使我们提出信息流的混合-压缩-精炼理论,试图解释 LLM 如何通过控制注意力与表征压缩来组织深度计算。具体而言,我们认为基于Transformer的 LLM 按三个 distinct 阶段处理标记:(1)早期层的广泛混合,(2)中层压缩计算中混合受限,(3)晚期层的选择性精炼。我们的框架帮助阐明了为何嵌入任务在中层表现最佳,而生成任务受益于完整深度处理,澄清了任务相关表征的差异。
引用
@article{arxiv.2510.06477,
title = {Attention Sinks and Compression Valleys in LLMs are Two Sides of the Same Coin},
author = {Enrique Queipo-de-Llano and Álvaro Arroyo and Federico Barbero and Xiaowen Dong and Michael Bronstein and Yann LeCun and Ravid Shwartz-Ziv},
journal= {arXiv preprint arXiv:2510.06477},
year = {2026}
}