KVSlimmer:基于KV不对称合并的理论洞察与实用优化
计算与语言
2026-03-10 v2
摘要
Key-Value(KV)缓存的日益增长的计算和内存需求显著限制了大型语言模型(LLM)的应用。虽然KV合并已成为突破性解决方案,但依赖于KV不对称性经验观察和基于梯度的Hessian近似的方法缺乏理论基础且在压缩和推理开销方面存在 suboptimal。为弥合这一差距,我们建立了理论框架,通过投影权重的谱能分布来刻画这种不对称性,表明Query/Key权重中集中态谱会诱导特征同质化,而Value权重中分布式谱则保持特征异质性。随后,我们引入KVSlimmer—a一种高效算法,通过数学精确的表述捕获确切的Hessian信息,并仅使用前向传递变量推导出闭式解,实现梯度-free方法,既节省内存又提高时间效率。广泛的实验在各种模型和基准测试中表明,KVSlimmer始终优于SOTA方法。例如,在Llama3.1-8B-Instruct上,它将LongBench平均得分提升0.92分,同时将内存成本和延迟分别降低29%和28%。代码:https://github.com/lianjunl13-sudo/KVSlimmer
引用
@article{arxiv.2603.00907,
title = {KVSlimmer: Theoretical Insights and Practical Optimizations for Asymmetric KV Merging},
author = {Lianjun Liu and Hongli An and Weiqi Yan and Xin Du and Shengchuan Zhang and Huazhong Liu and Yunshan Zhong},
journal= {arXiv preprint arXiv:2603.00907},
year = {2026}
}