注意力缩放在长上下文变换器中的关键性
机器学习
2025-10-08 v1 人工智能
离散数学
经典分析与常微分方程
摘要
随着大型语言模型扩展到更长的上下文,注意力层面临一种根本性病态:注意力得分随着上下文长度 的增加而趋向一致,导致标记聚类过度,这一现象称为秩坍缩。虽然注意力缩放通过对注意力得分乘以多对数因子 来有效解决这一缺陷,但该方法的理论依据仍缺乏。我们分析了一个简化且可处理的模型,以放大注意力缩放的效果。在该模型中,注意力呈现一种由缩放因子 控制的相变:缩放不足会导致所有标记坍缩到单个方向,而过度缩放则使注意力趋于恒等,从而消除标记之间的有意义交互。我们的主要结果确定了关键缩放 ,并为注意力缩放在 YaRN 和 Qwen 中的应用提供了严格的依据,阐明了为何在大上下文长度下,对数缩放如何保持稀疏且内容适应的注意力。
引用
@article{arxiv.2510.05554,
title = {Critical attention scaling in long-context transformers},
author = {Shi Chen and Zhengjiang Lin and Yury Polyanskiy and Philippe Rigollet},
journal= {arXiv preprint arXiv:2510.05554},
year = {2025}
}
备注
29 pages, 2 figures