注意力的前向传播与Frank-Wolfe
最优化与控制
2025-08-14 v1
摘要
我们研究在零温度() regime下获得的自注意力动力学的hardmax极限,并将其与有限情setting相关联。在此极限下,更新规则可视为对当前token嵌入的凸包上作用于二次目标的Frank-Wolfe步骤。当key-query矩阵为负半正定时,该方法会线性收缩所有token到原点。当其为正半正定时,将hardmax规则扩展至整个凸包会诱导Voronoi图:顶点为稳定点,内部点保持在其初始单元内,每个token沿直线移动至其单元顶点的方向,从而实现(超)指数收敛。作为副产品,我们也在此情setting下建立了相关ODE极限的良好定性。回到有限情setting,我们将自注意力动力学建模为马尔可夫链并证明了动态 metastability:几乎以确定概率,内部token在常数步数内接近顶点配置,并在随着呈指数增长的时间尺度内保持于小邻域内,最终坍缩至原点。因此,hardmax动力学在指数级时间尺度上准确近似有限过程。
引用
@article{arxiv.2508.09628,
title = {Attention's forward pass and Frank-Wolfe},
author = {Albert Alcalde and Borjan Geshkovski and Domènec Ruiz-Balet},
journal= {arXiv preprint arXiv:2508.09628},
year = {2025}
}