中文

KVSlimmer:基于KV不对称合并的理论洞察与实用优化

计算与语言 2026-03-10 v2

摘要

Key-Value(KV)缓存的日益增长的计算和内存需求显著限制了大型语言模型(LLM)的应用。虽然KV合并已成为突破性解决方案,但依赖于KV不对称性经验观察和基于梯度的Hessian近似的方法缺乏理论基础且在压缩和推理开销方面存在 suboptimal。为弥合这一差距,我们建立了理论框架,通过投影权重的谱能分布来刻画这种不对称性,表明Query/Key权重中集中态谱会诱导特征同质化,而Value权重中分布式谱则保持特征异质性。随后,我们引入KVSlimmer—a一种高效算法,通过数学精确的表述捕获确切的Hessian信息,并仅使用前向传递变量推导出闭式解,实现梯度-free方法,既节省内存又提高时间效率。广泛的实验在各种模型和基准测试中表明,KVSlimmer始终优于SOTA方法。例如,在Llama3.1-8B-Instruct上,它将LongBench平均得分提升0.92分,同时将内存成本和延迟分别降低29%和28%。代码:https://github.com/lianjunl13-sudo/KVSlimmer

关键词

引用

@article{arxiv.2603.00907,
  title  = {KVSlimmer: Theoretical Insights and Practical Optimizations for Asymmetric KV Merging},
  author = {Lianjun Liu and Hongli An and Weiqi Yan and Xin Du and Shengchuan Zhang and Huazhong Liu and Yunshan Zhong},
  journal= {arXiv preprint arXiv:2603.00907},
  year   = {2026}
}