驯服 KV 缓存驱逐脆弱性:面向 LLM 推理
计算与语言
2025-10-16 v1
摘要
大型语言模型已彻底变革自然语言处理,但其部署仍受制于变换器 Key-Value 缓存的巨大内存和运行时开销。为缓解此问题,近期方法采用评分-聚合框架驱逐不重要的缓存条目,基于稳定性假设——即固定子集的条目在生成期间始终保持重要。然而, prior work 主要聚焦于细化评分的重要性指标,而默认采用均值聚合 due to 对稳定性假设的忠实信任。在本工作中,我们认为该底层假设本质上脆弱,使均值聚合在极端情况下高度脆弱。为此,我们提出一种简单而优雅的防御性聚合策略:一种两步骤、线性时间的方法,可控制最坏情况风险,从而在极端情况下提供防护,同时几乎没有计算开销。 embodying 该策略,我们提出一种新颖的缓存驱逐方法 DefensiveKV 及其扩展版 Layer-DefensiveKV, incorporates 层级资源分配。我们的方法在七个任务领域(18 个数据集)上,将在 20% 缓存大小下的生成质量损失分别降低 2.3 倍和 4.3 倍。这些结果树立了新的性能基准,为通过最坏情况风险管理针对底层脆弱性进行缓存驱逐优化开辟了前景。我们的代码已公开于 https://github.com/FFY0/DefensiveKV。
引用
@article{arxiv.2510.13334,
title = {Taming the Fragility of KV Cache Eviction in LLM Inference},
author = {Yuan Feng and Haoyu Guo and JunLin Lv and S. Kevin Zhou and Xike Xie},
journal= {arXiv preprint arXiv:2510.13334},
year = {2025}
}