中文

KV 缓存压缩的陷阱

机器学习 2026-05-15 v2 人工智能

摘要

KV 缓存压缩承诺在性能方面几乎不受影响的情况下提高吞吐量和效率。尽管在吞吐量方面的收益是毫无争议的,并且最近的文献确实显示在特定基准测试上仅有最小退化,但在现实场景中(如多指令提示)下的影响仍不充分地被研究。在本文中,我们识别了实践者在部署压缩 KV 缓存的大型语言模型时应意识到的几个陷阱。我们在 Llama3.1 8B 和 Qwen2.5 14B 上评估了五种 KV 缓存压缩方法(StreamingLLM、SnapKV、TOVA、H2O 和 K-Norm),并使用 IFEval 进行多指令提示下的测试。重要的是,我们表明某些指令在压缩下会急剧退化,实际上使其被大型语言模型完全忽略。作为一个实际案例,我们以系统提示泄漏为案例研究,实证演示了压缩对泄漏和通用指令遵循的影响。我们确定了几个贡献系统提示泄漏的因素: 压缩方法、指令顺序和 KV 驱逐偏置。随后,我们提出了简便的 KV 缓存驱逐策略变更,以减少这些因素的影响并提高在多指令任务中的整体性能。

关键词

引用

@article{arxiv.2510.00231,
  title  = {The Pitfalls of KV Cache Compression},
  author = {Alex Chen and Renato Geh and Aditya Grover and Guy Van den Broeck and Daniel Israel},
  journal= {arXiv preprint arXiv:2510.00231},
  year   = {2026}
}

备注

In Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, ACL 2026