中文

注意力的前向传播与Frank-Wolfe

最优化与控制 2025-08-14 v1

摘要

我们研究在零温度(β+\beta\to+\infty) regime下获得的自注意力动力学的hardmax极限,并将其与有限β\beta情setting相关联。在此极限下,更新规则可视为对当前token嵌入的凸包上作用于二次目标的Frank-Wolfe步骤。当key-query矩阵为负半正定时,该方法会线性收缩所有token到原点。当其为正半正定时,将hardmax规则扩展至整个凸包会诱导Voronoi图:顶点为稳定点,内部点保持在其初始单元内,每个token沿直线移动至其单元顶点的方向,从而实现(超)指数收敛。作为副产品,我们也在此情setting下建立了相关ODE极限的良好定性。回到有限β\beta情setting,我们将自注意力动力学建模为马尔可夫链并证明了动态 metastability:几乎以确定概率,内部token在常数步数内接近顶点配置,并在随着β1\beta^{-1}呈指数增长的时间尺度内保持于小邻域内,最终坍缩至原点。因此,hardmax动力学在指数级时间尺度上准确近似有限β\beta过程。

关键词

引用

@article{arxiv.2508.09628,
  title  = {Attention's forward pass and Frank-Wolfe},
  author = {Albert Alcalde and Borjan Geshkovski and Domènec Ruiz-Balet},
  journal= {arXiv preprint arXiv:2508.09628},
  year   = {2025}
}