基于自适应结构稀疏注意力的 SampleAttention:近乎无损的长上下文 LLM 推理加速
计算与语言
2025-09-04 v3 人工智能
机器学习
摘要
大型语言模型 (LLM) 现在支持极长的上下文窗口,但原始注意力机制的二次复杂度导致显著的首字延迟 (TTFT)。现有方法需要额外的预训练或微调,常以牺牲模型准确率为代价。本文首先在理论和实证层面阐述了近乎无损的稀疏注意力。我们发现,动态在运行时以低开销捕获头级稀疏模式至关重要。为此,我们提出 SampleAttention 一种自适应结构且近乎无损的稀疏注意力。利用观察到的显著稀疏模式,SampleAttention 关注固定比例的相邻 token 以捕获局部窗口模式,并采用两阶段查询引导的键值过滤方法,以低开销自适应选择最小键值集合,以捕获列条纹模式。全面评估表明,SampleAttention 可无缝替换 LLM 中的原始注意力,几乎不损失准确率,将 TTFT 相较于 FlashAttention 降低最高可达 。
引用
@article{arxiv.2406.15486,
title = {SampleAttention: Near-Lossless Acceleration of Long Context LLM Inference with Adaptive Structured Sparse Attention},
author = {Qianchao Zhu and Jiangfei Duan and Chang Chen and Siran Liu and Guanyu Feng and Xin Lv and Xiao Chuanfu and Dahua Lin and Chao Yang},
journal= {arXiv preprint arXiv:2406.15486},
year = {2025}
}