Softmax注意力头的专化:来自高维单位置模型的洞见
机器学习
2026-03-05 v1 无序系统与神经网络
摘要
多头注意力使transformer模型能够同时表示多个注意力模式。经验上,注意力头的专化在训练的不同阶段依次出现,而许多头仍保持冗余并学习相似的表示。我们提出了一个捕捉这一现象的理论模型,基于多指数和单位置回归框架。在第一部分中,我们分析了在SGD下对多头softmax注意力的训练动力学,揭示了一个初始非专化阶段,随后是多阶段专化阶段,其中不同注意力头依次与潜在信号方向对齐。在第二部分中,我们研究了注意力激活函数对性能的影响。我们表明,softmax-1显著减少了无关注意力头的噪声。最后,我们引入了Bayes-softmax注意力,在该设置下实现最佳预测性能。
引用
@article{arxiv.2603.03993,
title = {Specialization of softmax attention heads: insights from the high-dimensional single-location model},
author = {M. Sagitova and O. Duranthon and L. Zdeborová},
journal= {arXiv preprint arXiv:2603.03993},
year = {2026}
}