中文

超越同质注意力:通过傅里叶近似KV缓存实现内存高效的LLM

计算与语言 2025-06-16 v1

摘要

随着上下文长度增加,大语言模型面临来自键-值(KV)缓存的日益增长的内存需求。现有压缩方法要么同质化头维度,要么依赖注意力引导的令牌剪枝,往往牺牲准确率或引入计算开销。我们提出FourierAttention,一个无需训练的框架,利用Transformer头维度的异构角色:较低维度优先处理局部上下文,而较高维度捕获长程依赖。通过将长上下文不敏感的维度投影到正交傅里叶基上,FourierAttention以固定长度的谱系数近似其时间演化。在LLaMA模型上的评估表明,FourierAttention在LongBench和Needle-In-A-Haystack(NIAH)上取得了最佳的长上下文准确率。此外,我们设计了一个自定义Triton内核FlashFourierAttention,通过精简的读写操作优化内存,实现高效部署且不牺牲性能。

关键词

引用

@article{arxiv.2506.11886,
  title  = {Beyond Homogeneous Attention: Memory-Efficient LLMs via Fourier-Approximated KV Cache},
  author = {Xiaoran Liu and Siyang He and Qiqi Wang and Ruixiao Li and Yuerong Song and Zhigeng Liu and Linlin Li and Qun Liu and Zengfeng Huang and Qipeng Guo and Ziwei He and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2506.11886},
  year   = {2025}
}

备注

10 pages, 7 figures, work in progress