关于 Transformer 子二次时间替代方案的根本限制
机器学习
2025-05-26 v2 计算复杂性
计算与语言
摘要
Transformer 架构在众多流行且具有影响力的大型语言模型中得到广泛部署。其核心是用于计算标记对之间相关性的注意力机制。注意力计算以输入规模的平方时间进行,已成为 Transformer 操作的时间瓶颈。为规避这一问题,研究者采用多种方法,包括设计用于快速执行注意力计算的启发式算法,或提出可更快计算的注意力机制替代方案。例如,状态空间模型如 Mamba 被设计为用接近线性时间的替代方案取代注意力机制。本文证明,任何此类方法都无法执行 Transformer 能够完成的重要任务(假设来自细粒度复杂度理论的一个流行猜想)。我们聚焦于文档相似性任务,即给定多个文档以查找(近似)最相似的那一对。我们证明 Transformer 能够完成该任务,且证明该任务无法通过任何算法在真正的亚二次时间内完成。换言之,任何可在亚二次时间内评估的模型——无论是由于注意力的亚二次时间启发式、更快的注意力替代方案如 Mamba,或其他任何原因——都无法完成该任务。也就是说,要执行涉及(隐式或显式)文档相似性的任务,可能仍需使用 Transformer 且无法避免其二次运行时间。
关键词
引用
@article{arxiv.2410.04271,
title = {Fundamental Limitations on Subquadratic Alternatives to Transformers},
author = {Josh Alman and Hantao Yu},
journal= {arXiv preprint arXiv:2410.04271},
year = {2025}
}