后规范可重新加强注意力机制
机器学习
2026-02-02 v2 人工智能
摘要
长度泛化是自主智能体在训练期间未遇到的更长上下文中执行任务的关键能力。为系统性地研究这一能力,我们测试模型在算法任务中对下一个标记分布的近似程度。这要考虑到多个下一个标记合法的现实可能性。我们提出了一个用于这一研究方向的原型基准:在集合补充任务中,模型需要对输入中不包含的标记进行均匀分布。我们证明了简单的变压器可以在此任务上进行长度泛化,但由于注意力扩散会导致性能下降。对注意力扩散如何发生的机制性理解让我们发现了一种补救方法:后规范可重新加强注意力。我们提出实验证据支持这一观点。我们还表明,指数移动平均可以帮助解决当多个下一个标记合法时出现的噪声梯度问题。我们在一套形式语言实验中验证了我们提出方法的通用适用性。我们的源代码将在发表后提供。
引用
@article{arxiv.2510.08341,
title = {Post-Norm can Resharpen Attention},
author = {Pál Zsámboki and Benjamin Levi and David Ansel Josef Smith and Mitansh Kagalwala and Arlington Kell and Samuel Liechty and Cong Wang},
journal= {arXiv preprint arXiv:2510.08341},
year = {2026}
}
备注
17 pages, 7 figures, 1 table