控制注意力 logits 的变化
机器学习
2025-11-27 v1
摘要
神经网络权重的稳定性是训练 transformer 模型的关键。查询和键权重尤其具有问题,因为它们倾向于在无干预的情况下持续增大。对查询和键应用归一化(即 "QK norm")在实践中可解决稳定性问题,但并非总是适用。例如,QK norm 不适用于多潜在注意力 (MLA),因为其在推理期间需要完全实例化查询和键,而 MLA 并未如此。本文我们建议,控制 logits 的变化对稳定性至关重要。我们表明,这些变化可以通过对查询和键权重分配与参数相关的学习率来控制。我们发现,此低成本干预允许我们提高网络的基准学习率,MLA 场景下表现优于其他方法,在使用多头注意力时,达到与 QK norm 相当的性能。
引用
@article{arxiv.2511.21377,
title = {Controlling changes to attention logits},
author = {Ben Anson and Laurence Aitchison},
journal= {arXiv preprint arXiv:2511.21377},
year = {2025}
}