中文

SWAN:稀疏 Winnowed 注意力机制通过无压缩 KV 缓存压缩降低推理内存

机器学习 2025-11-25 v1 人工智能 计算与语言

摘要

大型语言模型(LLMs)在自回归推理期间因 KV 缓存巨大的内存占用而面临显著瓶颈。现有的压缩技术,如 token 驱逐、量化或其他低秩方法,往往会导致信息丢失、固定限制,或引入显式解压缩步骤的显著计算开销。本工作引入了 SWAN,一种新型、无需微调的框架,消除了此类开销。我们的方法使用离线正交矩阵对 KV 缓存进行旋转和剪枝处理,然后可直接用于注意力计算,无需任何重构。我们的大量实验表明,SWAN 结合小型稠密缓冲区,可在 KV 缓存每 token 采用 50-60% 的激进压缩时,保持性能接近未压缩基线。一个关键优势是其运行时可调压缩比例,允许运营商动态调整内存占用,这种灵活性在需要固定离线配置的方法中不存在。这一无压缩设计、在压缩下的高性能以及可适应性的组合,使 SWAN 成为为长上下文服务的 LLMs 实用且高效的解决方案。

关键词

引用

@article{arxiv.2511.18936,
  title  = {SWAN: Sparse Winnowed Attention for Reduced Inference Memory via Decompression-Free KV-Cache Compression},
  author = {Santhosh G S and Saurav Prakash and Balaraman Ravindran},
  journal= {arXiv preprint arXiv:2511.18936},
  year   = {2025}
}