中文

注意力的梯度动力学:交叉熵如何塑造贝叶斯流形

机器学习 2026-05-19 v5 人工智能 机器学习

摘要

变压器在精心构建的“贝叶斯风洞”中以及大规模语言模型中,都表现出精确的概率推理能力,但梯度式学习如何创建所需内部几何的机制仍不清晰。我们对交叉熵训练如何重塑变压器注意力头中的注意力得分和值向量进行完整的一阶分析。我们的核心结果是一种基于优势的路由法则,用于注意力得分:\nLsij=αij(bijEαi[b]),bij:=uivj, \frac{\partial L}{\partial s_{ij}} = \alpha_{ij}\bigl(b_{ij}-\mathbb{E}_{\alpha_i}[b]\bigr), \qquad b_{ij} := u_i^\top v_j, \n以及值向量的一种责任加权更新:\nΔvj=ηiαijui, \Delta v_j = -\eta\sum_i \alpha_{ij} u_i, \n其中 uiu_i 为位置 ii 处的上游梯度,αij\alpha_{ij} 为注意力权重。这些方程在路由和内容协同专化之间形成正反馈回路:查询更强地路由给其误差信号信号 above-average 的值,而这些值又被拉向使用它们的查询。我们表明,这种耦合专化的行为类似于一个两时刻的 EM 流程:注意力权重实现 E 步(软责任),而值实现 M 步(责任加权原型更新),查询和键调整假设框架。通过受控仿真,包括黏性马尔可夫链任务,其中我们将闭式 EM 风格更新与标准 SGD 进行比较,我们展示了最小化交叉熵的同一梯度动力学也塑造了我们在伴随工作中确定的实现贝叶斯推断的低维流形。这导致一个统一的图景:优化(梯度流)产生几何(贝叶斯流形),而该几何又支持功能(原地概率推理)。

关键词

引用

@article{arxiv.2512.22473,
  title  = {Gradient Dynamics of Attention: How Cross-Entropy Sculpts Bayesian Manifolds},
  author = {Naman Agarwal and Siddhartha R. Dalal and Vishal Misra},
  journal= {arXiv preprint arXiv:2512.22473},
  year   = {2026}
}

备注

v2: Add dual-entropy connection - advantage signal drives \r{ho} down; fix duplicate bibliography entries (synced from Paper I)