KV-CoRE:评估 LLMs 中 KV 缓存数据依赖性低秩压缩性的基准
计算与语言
2026-02-10 v2
摘要
大语言模型依赖 kv 缓存以避免在自回归解码期间进行冗余计算,但随着上下文长度增长,读取和写入缓存会迅速饱和 GPU 内存带宽。近期研究探索了 KV 缓存压缩,然而大多数方法忽略了 kv 缓存的数据依赖性以及其在不同层之间的变化。我们引入 KV-CoRE(KV-cache Compressibility by Rank Evaluation),一种基于奇异值分解(SVD)的用于量化 kv 缓存数据依赖性低秩压缩性的方法。KV-CoRE 在弗罗benius范数下计算最优低秩近似值,并且由于是梯度-free 且增量的,能够高效地进行数据集级别、层级评估。通过该方法,我们分析了多个模型和数据集,涵盖五个英文领域和十六种语言,发现压缩性与模型架构、训练数据和语言覆盖之间存在系统性关联。在此分析过程中,我们采用标准化有效秩(Normalized Effective Rank)作为压缩性指标,表明它与压缩下的性能下降高度相关。我们的研究建立了原则化的评估框架和 LLMs 中 kv 缓存压缩性的第一个大规模基准,为动态数据感知压缩和数据中心模型开发提供了见解。
引用
@article{arxiv.2602.05929,
title = {KV-CoRE: Benchmarking Data-Dependent Low-Rank Compressibility of KV-Caches in LLMs},
author = {Jian Chen and Zhuoran Wang and Jiayu Qin and Ming Li and Meng Wang and Changyou Chen and Yin Chen and Qizhen Weng and Yirui Liu},
journal= {arXiv preprint arXiv:2602.05929},
year = {2026}
}