中文

控制注意力 logits 的变化

机器学习 2025-11-27 v1

摘要

神经网络权重的稳定性是训练 transformer 模型的关键。查询和键权重尤其具有问题,因为它们倾向于在无干预的情况下持续增大。对查询和键应用归一化(即 "QK norm")在实践中可解决稳定性问题,但并非总是适用。例如,QK norm 不适用于多潜在注意力 (MLA),因为其在推理期间需要完全实例化查询和键,而 MLA 并未如此。本文我们建议,控制 logits 的变化对稳定性至关重要。我们表明,这些变化可以通过对查询和键权重分配与参数相关的学习率来控制。我们发现,此低成本干预允许我们提高网络的基准学习率,MLA 场景下表现优于其他方法,在使用多头注意力时,达到与 QK norm 相当的性能。

关键词

引用

@article{arxiv.2511.21377,
  title  = {Controlling changes to attention logits},
  author = {Ben Anson and Laurence Aitchison},
  journal= {arXiv preprint arXiv:2511.21377},
  year   = {2025}
}