中文

缩放点积注意力作为单侧熵最优传输

机器学习 2025-12-30 v2 机器学习

摘要

缩放点积注意力(SDPA)机制是现代深度学习的核心组成部分,但其数学形式通常由启发式方法驱动。本工作为SDPA提供了一个第一性原理的证明。我们首先证明,注意力的前向传播是一个退化的、单侧熵最优传输(EOT)问题的精确解,该问题寻求一个在最大化相似度的同时具有最大熵的分布。这种优化视角对反向传播有直接影响。我们证明,通过反向传播计算的标准梯度在数学上等同于一种基于优势的策略梯度,这是一种来自强化学习的方差缩减更新规则。至关重要的是,我们证明了前向传播的EOT公式在注意力分布空间上诱导了一种特定的信息几何。正是这种以费舍尔信息矩阵为特征的几何结构,决定了学习梯度的精确形式,揭示了基于优势的更新是所求解优化问题的自然结果。这种统一的观点将SDPA揭示为一种原则性机制,其中前向传播执行最优推断,而反向传播实现了一个理性的、流形感知的学习更新。

关键词

引用

@article{arxiv.2508.08369,
  title  = {Scaled-Dot-Product Attention as One-Sided Entropic Optimal Transport},
  author = {Elon Litman},
  journal= {arXiv preprint arXiv:2508.08369},
  year   = {2025}
}