中文

通过解码时间贡献稀疏性加速预填充

计算与语言 2026-04-22 v4

摘要

大型语言模型(LLM)在输入长度上具有二次注意力复杂度,这在预填充阶段构成了主要时间瓶颈。现有的加速方法主要通过估计注意力得分较高的块并应用动态稀疏注意力来利用注意力得分稀疏性。在本工作中,我们识别了预填充阶段另一种未被充分利用的稀疏性,即解码时间贡献稀疏性——许多注意力块在预填充期间具有非平凡的注意力得分,但对后续解码贡献微乎其微,正如由梯度分析所示。基于此观察,我们提出了TriangleMix,这是一种训练无关的静态注意力模式,前者在部分层中使用稠密注意力,而在其余层中切换为Triangle注意力。大量实验表明,TriangleMix在相对于稠密注意力几乎无损地保持性能的同时,显著减少了Triangle层中的注意力开销。对于128K输入,Triangle注意力在注意力计算上实现了15.3倍加速,显著超过了典型动态稀疏方法的加速(1.9倍至3.4倍)。此外,TriangleMix可以无缝地与动态稀疏方法结合,相较于仅使用动态稀疏方法,额外降低TTFT(首字延迟)6%至19%。我们的代码已发布于https://aka.ms/TriangleMix。

关键词

引用

@article{arxiv.2507.21526,
  title  = {Accelerating Prefilling via Decoding-time Contribution Sparsity},
  author = {Zhiyuan He and Yike Zhang and Chengruidong Zhang and Huiqiang Jiang and Yuqing Yang and Lili Qiu},
  journal= {arXiv preprint arXiv:2507.21526},
  year   = {2026}
}