中文

更少即更好:基于跨头统一稀疏注意力的快速而准确推理

计算与语言 2026-04-29 v2 人工智能

摘要

大规模推理模型通过测试时扩展实现了卓越的性能,但这会因从短提示进行长解码而导致巨大的计算开销。虽然稀疏注意力可降低延迟和内存使用,但现有方法常因在长生成期间选择错误累积而降低推理准确性,或需要高昂的重新训练。我们引入LessIsMore,这是一种用于长程推理的训练-free 稀疏注意力机制。我们的关键洞察是:推理中的token重要性是全局且稳定的:关键token在注意力头之间基本相同,并且在解码步骤中保持稳定。基于这一结构,LessIsMore强制执行跨头统一的token选择,并通过稳定的回顾窗口保留最近的上下文,生成一个可跨层重用的全局一致token 集合。在多个模型家族和具有挑战性的推理基准测试中,LessIsMore在attended 到大幅度减少的token 的同时,匹配或提高了准确性。通过内核级优化,LessIsMore实现了最高可达 1.6×1.6\times 的端到端解码加速和最高可达 1.72×1.72\times 的稀疏注意力计算加速,额外的长上下文结果表明了我们方法的普适性。代码可在 \href{https://github.com/DerrickYLJ/LessIsMore}{https://github.com/DerrickYLJ/LessIsMore} 获取。

关键词

引用

@article{arxiv.2508.07101,
  title  = {Less Is More: Fast and Accurate Reasoning with Cross-Head Unified Sparse Attention},
  author = {Lijie Yang and Zhihao Zhang and Arti Jain and Shijie Cao and Baihong Yuan and Yiwei Chen and Zhihao Jia and Ravi Netravali},
  journal= {arXiv preprint arXiv:2508.07101},
  year   = {2026}
}