仿射缩放注意力:面向灵活且稳定的变换器注意力
计算与语言
2026-02-27 v1 人工智能
摘要
变换器注意力通常使用 softmax 归一化实现,这会强制注意力权重进行单位求和归一化。虽然在许多设置下效果良好,但这种约束可能限制了对注意力幅度的灵活控制,以及在训练期间导致注意力模式过于集中或不稳定。先前的工作探索了诸如注意力 sink 或门控机制的修改,但这些方法仅提供有限或间接的注意力重标控制。我们提出了仿射缩放注意力,这是一种对标准注意力的简单扩展,引入输入依赖的缩放,并对 softmax 归一化后的注意力权重应用相应的偏置项。这种设计在保持价值表示的聚合的同时,放宽了严格的归一化约束,使模型能够受控地调整注意力的相对分布和规模。我们在多个模型规模上对仿射缩放注意力进行大规模语言模型预训练中的经验评估。实验结果表明,与标准 softmax 注意力和注意力 sink 基线相比,仿射缩放注意力在训练稳定性、优化行为和下游任务性能方面 consistently 获得改进。这些发现表明,适度的注意力输出重标为改善变换器模型中注意力行为提供了实用且有效的方法。
关键词
引用
@article{arxiv.2602.23057,
title = {Affine-Scaled Attention: Towards Flexible and Stable Transformer Attention},
author = {Jeongin Bae and Baeseong Park and Gunho Park and Minsub Kim and Joonhyung Lee and Junhee Yoo and Sunghyeon Woo and Jiwon Ryu and Se Jung Kwon and Dongsoo Lee},
journal= {arXiv preprint arXiv:2602.23057},
year = {2026}
}
备注
Preprint. 14 pages, 11 figures