中文

注意力作为内在经验贝叶斯:通过粒子动力学的两阶段视角

机器学习 2026-05-29 v1 动力系统 机器学习

摘要

我们研究在全token损坏条件下仅使用注意力的最小变压器,表明它们容纳一种两阶段经验贝叶斯解释。单个注意力步骤计算以上下文定义的经验分布为依据的核加权后验均值。深度通过粒子动力学细化该分布(阶段1),而长程跳跃连接将带噪输入作为查询进行后验推断(阶段2),揭示了深度与注意力残差在统计上的不同作用。该框架孤立地捕获了一个最小化设置,其中上下文本身在内在推断中引起深度相关的能量景观。我们表明,在无显式噪声计划的情况下,有效去噪可以从固定的核带宽和有限积分时域中产生,从而建立一种原则性的深度-噪声关系。我们进一步建立了一个后验均值恢复保证,适用于一类良好行为的先验分布,其中经验估计器在渐近条件下收敛于贝叶斯最优预测器。将这些动力学连接到逆扩散极限,我们的结果为注意力作为通过基于样本的后验估计进行内在推断提供了统计解释,无需显式的密度建模。

关键词

引用

@article{arxiv.2605.29351,
  title  = {Attention as In-Context Empirical Bayes: A Two-Stage View via Particle Dynamics},
  author = {Matthew Smart and Soumya Ganguly and Nilava Metya and Alexandre V. Morozov and Anirvan M. Sengupta},
  journal= {arXiv preprint arXiv:2605.29351},
  year   = {2026}
}

备注

52 pages, 5 figures