中文

高效注意力机制:并行性故事

机器学习 2025-09-12 v1

摘要

Transformer 具备模拟大规模并行计算(MPC)算法的表示能力,但因其二次时间复杂度,严重限制了其可扩展性。我们引入一种高效注意力机制,称为近似最近邻注意力(ANNA),具有亚二次时间复杂度。我们证明了 ANNA-Transformer(1)在标准注意力在表达能力方面保持了之前的优势,即匹配 MPC 算法的能力;(2)能够解决诸如 Match2 和 kk-跳等关键推理任务,具有近乎最优的深度。基于 MPC 框架,我们进一步证明了常数深度的 ANNA-Transformer 能够模拟常数深度的低秩 Transformer,从而为广泛的高效注意力近似提供了统一的推理方法。

关键词

引用

@article{arxiv.2509.09001,
  title  = {Fast attention mechanisms: a tale of parallelism},
  author = {Jingwen Liu and Hantao Yu and Clayton Sanford and Alexandr Andoni and Daniel Hsu},
  journal= {arXiv preprint arXiv:2509.09001},
  year   = {2025}
}