Scout Before You Attend:基于草图与步行的稀疏注意力高效 LLM 推理
机器学习
2026-02-10 v1 人工智能
摘要
自注意力机制在长上下文 LLM 推理中主导计算和内存开销,涵盖预填充和解码阶段。为此,我们引入一种名为 Sketch&Walk 注意力的训练-free 稀疏注意力方法,通过轻量草图和确定性步行机制确定稀疏性。Sketch&Walk 对注意力得分应用哈达玛矩阵 Sketching 以获得低成本近似值,然后通过步行机制将这些估计在层之间聚合,捕捉跨单个 token 直接相互作用之外的注意力影响。累积的步行得分用于选择前 k 个注意力块,实现单一训练-free 算法在预填充和解码阶段均可动态稀疏化,并配合自定义稀疏注意力内核。广泛的模型和任务实验表明,Sketch&Walk 在注意力密度为 20% 时保持近乎无损的准确度,且在部分场景下甚至能略胜于稠密注意力,同时实现最高可达 6 倍的推理加速。
引用
@article{arxiv.2602.07397,
title = {Scout Before You Attend: Sketch-and-Walk Sparse Attention for Efficient LLM Inference},
author = {Hoang Anh Duy Le and Sahil Joshi and Zeyu Yang and Zhaozhuo Xu and Anshumali Shrivastava},
journal= {arXiv preprint arXiv:2602.07397},
year = {2026}
}