高效注意力机制:并行性故事
机器学习
2025-09-12 v1
摘要
Transformer 具备模拟大规模并行计算(MPC)算法的表示能力,但因其二次时间复杂度,严重限制了其可扩展性。我们引入一种高效注意力机制,称为近似最近邻注意力(ANNA),具有亚二次时间复杂度。我们证明了 ANNA-Transformer(1)在标准注意力在表达能力方面保持了之前的优势,即匹配 MPC 算法的能力;(2)能够解决诸如 Match2 和 -跳等关键推理任务,具有近乎最优的深度。基于 MPC 框架,我们进一步证明了常数深度的 ANNA-Transformer 能够模拟常数深度的低秩 Transformer,从而为广泛的高效注意力近似提供了统一的推理方法。
引用
@article{arxiv.2509.09001,
title = {Fast attention mechanisms: a tale of parallelism},
author = {Jingwen Liu and Hantao Yu and Clayton Sanford and Alexandr Andoni and Daniel Hsu},
journal= {arXiv preprint arXiv:2509.09001},
year = {2025}
}