中文

Scaled Dot-Product Attention 实现对输入向量在共面上的投影

机器学习 2026-02-04 v1 人工智能 信号处理

摘要

Scaled点积注意力(SDPA)是大语言模型及其他非线性信号处理应用的关键组件,正是其成功所在。传统观点基于从数据库理论借来的“查询、键、值”概念,但这些概念难以与标准数学信号处理方法相一致。我们展示,SDPA可以以另一种但数学等价的形式重写,作为将输入向量投影到由输入自身决定的共面上的操作。因此,SDPA发现输入中随时间变化和情境依赖的非线性依赖关系。重写后的SDPA形式使前馈和学习算法的速度得以提升,更重要的是,为潜在的扩展提供了可能性。在语言语境下,我们重新解释SDPA的作用,即在输入向量集合所lie于的共面上寻找随时间变化的情境意义。输入标记嵌入随后被当地情境共面所修改。此解释与“自注意力”概念截然不同,为针对具有局部非线性依赖关系的时间序列数据使用SDPA提供了强有力的依据。

关键词

引用

@article{arxiv.2602.02521,
  title  = {Scaled Dot-Product Attention implements projection of inputs onto a common surface},
  author = {Terence D Sanger},
  journal= {arXiv preprint arXiv:2602.02521},
  year   = {2026}
}