中文

为何 Softmax 注意力优于线性注意力

计算与语言 2026-03-16 v2 机器学习

摘要

大型 transformer 模型已在众多自然语言处理任务中取得最先进的结果。在 transformer 架构的关键组件中,注意力机制通过利用 softmax 函数捕获序列内 token 交互,起着至关重要的作用。相反,线性注意力通过以线性复杂度近似 softmax 操作,提供了一种计算效率更高的替代方案。然而,与传统 softmax 注意力机制相比,它表现出显著的性能下降。在本文中,我们弥补了在理论上理解 softmax 与线性注意力之间实际性能差距原因方面的不足。通过对这两种注意力机制进行全面比较分析,我们阐明了在大多数场景下 softmax 注意力优于线性注意力的潜在原因。

关键词

引用

@article{arxiv.2310.11685,
  title  = {Why Softmax Attention Outperforms Linear Attention},
  author = {Yichuan Deng and Zhao Song and Kaijun Yuan and Tianyi Zhou},
  journal= {arXiv preprint arXiv:2310.11685},
  year   = {2026}
}