LKV:面向 LLM KV 缓存驱逐的头级预算与 Token 选择的端到端学习
机器学习
2026-05-11 v1 计算与语言
摘要
大型语言模型(LLM)的长上下文推理受限于键值缓存内存的线性增长。现有的 KV 缓存压缩范式从根本上受限于启发式方法:启发式预算分配依赖统计先验而非任务目标,导致资源错配;而启发式选择依赖耦合的查询-键交互或静态归纳偏置(如注意力汇聚)。为解决此局限性,我们提出了 LKV(Learned KV Eviction),将 KV 压缩表述为端到端可微优化问题。LKV 集成了用于学习任务优化全局预算的 LKV-H,以及用于在不具现化注意力矩阵的情况下推导内在 KV 重要性的 LKV-T。此设计绕过了启发式代理,严格将压缩与任务目标对齐。广泛评估表明,LKV 在高压缩率下的 LongBench 和 RULER 基准上均达到了最先进的性能。特别是在 LongBench 上,LKV 仅保留 15% 的 KV 缓存即可实现近乎无损的性能。关键在于,我们的分析确定学习到的预算分配是保真度的主要驱动因素,证明数据驱动的分配对于克服手工启发式方法的局限性至关重要。
引用
@article{arxiv.2605.06676,
title = {LKV: End-to-End Learning of Head-wise Budgets and Token Selection for LLM KV Cache Eviction},
author = {Enshuai Zhou and Yifan Hao and Chao Wang and Rui Zhang and Di Huang and Jiaming Guo and Xing Hu and Zidong Du and Qi Guo and Yunji Chen},
journal= {arXiv preprint arXiv:2605.06676},
year = {2026}
}