注意力的标记样本复杂度
机器学习
2026-03-24 v2
摘要
随着大型语言模型上下文窗口的持续扩大,必要的是描述注意力在极端序列长度下的行为。我们引入标记样本复杂度:注意力在 个标记上计算收敛到其无限标记极限的速率。在两个层面上估计有限- 收敛界限:注意力图的点一致性均匀收敛,以及变换后标记分布矩的收敛。对于紧支撑(更一般地说是亚高斯)分布,我们的第一个结果表明,注意力图在半径为 的球上以 的速率收敛,其中 随 指数增长。在较大的 时,此估计失去实际价值,我们的第二个结果针对此问题,确立了变换后分布矩(注意力层输出的标记)的收敛速率。在这种情况下,速率为 ,其中 ,且 取决于分布支撑域的大小。指数 取决于注意力几何和标记分布的谱特性。我们还检查注意力参数趋于无穷大且 softmax 趋向硬最大的情况,在此设置下,我们建立了对数收敛速率。对合成高斯数据和真实 BERT 模型在维基百科文本上的实验确认了我们的预测。
引用
@article{arxiv.2512.10656,
title = {Token Sample Complexity of Attention},
author = {Léa Bohbot and Cyril Letrouit and Gabriel Peyré and François-Xavier Vialard},
journal= {arXiv preprint arXiv:2512.10656},
year = {2026}
}