中文

Lil:稀疏注意力算法在长解码阶段的适用性

计算与语言 2026-04-21 v3 人工智能 机器学习

摘要

大语言模型(LLM)在广泛的复杂任务上表现出强大能力,正逐渐被大规模部署,给推理效率带来巨大压力。先前的工作通常将推理分解为预填充和解码阶段,其中解码阶段占据总体延迟的主导地位。为降低解码阶段的时间和空间复杂度,相关工作引入了稀疏注意力算法。在本文中,我们两手三脚地表明,稀疏注意力实际上可能单然增加端到端复杂度:信息损失常常诱导显著更长的序列,一种我们称之为"Less is Less"(Lil)的现象。为缓解Lil问题,我们提出一种早期停止算法,用于检测稀疏解码中信息损失超过信息收益的阈值。我们的早期停止算法在推理密集型基准测试中将token消耗降低最高可达90%,而准确度退化仅有限于2%以下。

关键词

引用

@article{arxiv.2601.03043,
  title  = {Lil: Less is Less When Applying Post-Training Sparse-Attention Algorithms in Long-Decode Stage},
  author = {Junhao Hu and Fangze Li and Mingtao Xu and Feifan Meng and Shiju Zhao and Tiancheng Hu and Ting Peng and Anmin Liu and Wenrui Huang and Chenxu Liu and Ziyue Hua and Tao Xie},
  journal= {arXiv preprint arXiv:2601.03043},
  year   = {2026}
}