中文

注意力的标记样本复杂度

机器学习 2026-03-24 v2

摘要

随着大型语言模型上下文窗口的持续扩大,必要的是描述注意力在极端序列长度下的行为。我们引入标记样本复杂度:注意力在 nn 个标记上计算收敛到其无限标记极限的速率。在两个层面上估计有限-nn 收敛界限:注意力图的点一致性均匀收敛,以及变换后标记分布矩的收敛。对于紧支撑(更一般地说是亚高斯)分布,我们的第一个结果表明,注意力图在半径为 RR 的球上以 C(R)/nC(R)/\sqrt{n} 的速率收敛,其中 C(R)C(R)RR 指数增长。在较大的 RR 时,此估计失去实际价值,我们的第二个结果针对此问题,确立了变换后分布矩(注意力层输出的标记)的收敛速率。在这种情况下,速率为 C(R)/nβC'(R)/n^{\beta},其中 β<tfrac12\beta<\\tfrac{1}{2},且 C(R)C'(R) 取决于分布支撑域的大小。指数 β\beta 取决于注意力几何和标记分布的谱特性。我们还检查注意力参数趋于无穷大且 softmax 趋向硬最大的情况,在此设置下,我们建立了对数收敛速率。对合成高斯数据和真实 BERT 模型在维基百科文本上的实验确认了我们的预测。

关键词

引用

@article{arxiv.2512.10656,
  title  = {Token Sample Complexity of Attention},
  author = {Léa Bohbot and Cyril Letrouit and Gabriel Peyré and François-Xavier Vialard},
  journal= {arXiv preprint arXiv:2512.10656},
  year   = {2026}
}