中文

从数值方法视角看注意力机制:近似方法与替代表述

数值分析 2026-04-03 v1 数值分析

摘要

注意力机制是现代Transformer架构的计算核心,但其在输入序列长度上的二次复杂度是大规模推理的瓶颈。这驱动了一系列旨在通过近似和重构加速注意力的工作。本综述从数值分析视角重访注意力机制,特别关注数值线性代数的工具和视角。我们的目标有两个:首先,我们旨在系统性地归类和概述各种快速近似方法,依据其所利用的数值原理。这些包括稀疏性和聚类方法、低秩和子空间投影技术、随机抽样方法以及张量分解。我们还讨论了受 kernel 启发的注意力重构以及最近的架构变体,如 Latent Attention,修改标准 softmax 表述以提高效率。其次,通过在统一的数学框架中呈现这些发展,我们旨在搭建学科间的鸿沟,凸显数值线性代数等计算数学领域为可扩展注意力机制设计提供的进一步贡献机会。

关键词

引用

@article{arxiv.2604.01757,
  title  = {Attention Mechanisms Through the Lens of Numerical Methods: Approximation Methods and Alternative Formulations},
  author = {Michel Fabrice Serret and Alice Cortinovis and Yijun Dong and Diana Halikias and Anna Ma and Fabio Matti and Deanna Needell and Katherine J. Pearce and Elizaveta Rebrova and Disha Shur and Rudi Smith and Hai-Xiao Wang and Laura Grigori},
  journal= {arXiv preprint arXiv:2604.01757},
  year   = {2026}
}

备注

41 pages, 14 figures