中文

面向Transformer解码阶段的轻量化注意力机制:硬件感知的可扩展注意力机制

硬件体系结构 2025-01-15 v2 机器学习

摘要

Transformer-based模型已成为自然语言处理、自然语言生成和图像生成中最广泛使用的架构之一。该架构的规模不断增长,已达到数十亿参数。这些巨大的模型在内存上非常耗费,即使是在最先进的AI加速器(如GPU)上,也会造成显著的推理延迟。 Specifically,注意力操作的时间和空间复杂度随总上下文长度(即提示和输出标记)呈二次增长。因此,已提出各种优化技术,如键值张量缓存和FlashAttention计算,以满足此类大型模型的低延迟需求。然而,这些技术并不针对推理过程中不同阶段的计算特性进行设计。为此,我们提出LeanAttention,即一种针对解码器-only Transformer模型的标记生成阶段(解码阶段)计算自注意力的可扩展技术。LeanAttention通过重新设计解码阶段的执行流程,实现了对长上下文长度的可扩展注意力机制。我们确定,在线softmax的关联属性可被视为归约操作,从而允许我们在这些大型上下文长度上对注意力计算进行并行化。我们将“stream-K”风格的块状计算归约扩展到自注意力,从而实现并行计算,平均实现2.6倍的注意力执行加速,最高可达8.33倍512k上下文长度的加速。

关键词

引用

@article{arxiv.2405.10480,
  title  = {Lean Attention: Hardware-Aware Scalable Attention Mechanism for the Decode-Phase of Transformers},
  author = {Rya Sanovar and Srikant Bharadwaj and Renee St. Amant and Victor Rühle and Saravan Rajmohan},
  journal= {arXiv preprint arXiv:2405.10480},
  year   = {2025}
}

备注

13 pages, 10 figures