多头自注意力的梯度流结构与定量动力学
机器学习
2026-05-11 v2
摘要
Transformer自注意力可解释为单位球面上的梯度流,其中token在softmax相互作用势场下演化并趋于形成簇。虽然先前工作已建立单头注意力的聚类行为,但在多头设置下由于头之间存在几何干扰,导致标准的单调性论证失效。本文发展了多头自注意力动力学的理论框架,解决了几个开放问题。我们表明,在得分矩阵满足适当条件时,一种自然的多头能量函数在平坦动力学和球面动力学中均非递减。我们识别了导致逐头单调性的关键障碍为径向阴影项,这些项是将每个头的输出投影到token方向上,即使在正交假设下也仍然存在。我们引入一种确保单调性的充分条件并建立了对近似正交性的鲁棒性。在一个简化的标量头 regime 下,假设token配置等角度,我们推导出决定聚类行为的临界反温度的闭式表达式,表明异构头表现出超加性聚类速率。在该 regime 下,我们还证明了在线性化动力学中,ReLU注意力与softmax注意力在聚类时间上的分离。最后,我们建立了熵产生恒等式,表明注意力熵在聚类进行的过程中单调增加至平衡。我们的结果为多头注意力的动力学提供了统一视角,阐明了Transformer模型中聚类和稳定性的机制。
引用
@article{arxiv.2605.04279,
title = {Gradient Flow Structure and Quantitative Dynamics of Multi-Head Self-Attention},
author = {Ayan Pendharkar},
journal= {arXiv preprint arXiv:2605.04279},
year = {2026}
}
备注
20 pages, 5 figures