FASA:频率感知稀疏注意力
计算与语言
2026-03-03 v3
摘要
大型语言模型(LLM)的部署在处理长输入时面临关键瓶颈:键值(KV)缓存的高额内存占用。为解决这一瓶颈,token剪枝范式利用注意力稀疏性 selectively 保留下小型且关键 token 子集。然而,现有方法不足,静态方法风险不可逆的信息损失,动态策略使用的启发式方法不足以捕捉token重要性的 query 依赖性。我们提出FASA,一种新型框架,通过动态预测token重要性实现 query 感知的token驱逐。FASA源于对RoPE的一种新见解:在频率块(FC)层面发现功能稀疏性。我们的关键发现是,小且可识别的"支配性"FC子集始终与完整注意力头保持高的上下文一致性。这提供了一种稳健且无计算开销的代理,用于识别关键token。基于此见解,FASA首先使用支配性FC识别关键token集合,然后仅对此修剪子集执行聚焦注意力计算。在从序列建模到复杂推理链(CoT)推理的广泛长上下文任务上,FASA始终优于所有token驱逐基线,实现接近或准oracle的准确度,在各种约束预算下展现出惊人的鲁棒性。值得注意的是,在LongBench-V1上,FASA仅保留256个token即可达到近100%的完整KV性能,在AIME24上实现2.56倍的加速,仅使用18.9%的缓存。
引用
@article{arxiv.2602.03152,
title = {FASA: Frequency-aware Sparse Attention},
author = {Yifei Wang and Yueqi Wang and Zhenrui Yue and Huimin Zeng and Yong Wang and Ismini Lourentzou and Zhengzhong Tu and Xiangxiang Chu and Julian McAuley},
journal= {arXiv preprint arXiv:2602.03152},
year = {2026}
}
备注
Accepted by ICLR 2026