中文

注意力缩放在长上下文变换器中的关键性

机器学习 2025-10-08 v1 人工智能 离散数学 经典分析与常微分方程

摘要

随着大型语言模型扩展到更长的上下文,注意力层面临一种根本性病态:注意力得分随着上下文长度 nn 的增加而趋向一致,导致标记聚类过度,这一现象称为秩坍缩。虽然注意力缩放通过对注意力得分乘以多对数因子 βn\beta_n 来有效解决这一缺陷,但该方法的理论依据仍缺乏。我们分析了一个简化且可处理的模型,以放大注意力缩放的效果。在该模型中,注意力呈现一种由缩放因子 βn\beta_n 控制的相变:缩放不足会导致所有标记坍缩到单个方向,而过度缩放则使注意力趋于恒等,从而消除标记之间的有意义交互。我们的主要结果确定了关键缩放 βnlogn\beta_n \asymp \log n,并为注意力缩放在 YaRN 和 Qwen 中的应用提供了严格的依据,阐明了为何在大上下文长度下,对数缩放如何保持稀疏且内容适应的注意力。

关键词

引用

@article{arxiv.2510.05554,
  title  = {Critical attention scaling in long-context transformers},
  author = {Shi Chen and Zhengjiang Lin and Yury Polyanskiy and Philippe Rigollet},
  journal= {arXiv preprint arXiv:2510.05554},
  year   = {2025}
}

备注

29 pages, 2 figures