Scaled Dot-Product Attention 实现对输入向量在共面上的投影
机器学习
2026-02-04 v1 人工智能
信号处理
摘要
Scaled点积注意力(SDPA)是大语言模型及其他非线性信号处理应用的关键组件,正是其成功所在。传统观点基于从数据库理论借来的“查询、键、值”概念,但这些概念难以与标准数学信号处理方法相一致。我们展示,SDPA可以以另一种但数学等价的形式重写,作为将输入向量投影到由输入自身决定的共面上的操作。因此,SDPA发现输入中随时间变化和情境依赖的非线性依赖关系。重写后的SDPA形式使前馈和学习算法的速度得以提升,更重要的是,为潜在的扩展提供了可能性。在语言语境下,我们重新解释SDPA的作用,即在输入向量集合所lie于的共面上寻找随时间变化的情境意义。输入标记嵌入随后被当地情境共面所修改。此解释与“自注意力”概念截然不同,为针对具有局部非线性依赖关系的时间序列数据使用SDPA提供了强有力的依据。
引用
@article{arxiv.2602.02521,
title = {Scaled Dot-Product Attention implements projection of inputs onto a common surface},
author = {Terence D Sanger},
journal= {arXiv preprint arXiv:2602.02521},
year = {2026}
}