均匀键、异构值:利用局部 KV 缓存非对称性提升长上下文 LLM 性能
计算与语言
2025-11-07 v2
摘要
近期大语言模型(LLM)的进展凸显了延长上下文长度的重要性,但注意力机制的二次复杂度为高效长上下文建模带来了重大挑战。KV 缓存压缩已成为解决此问题的关键方法。通过大量经验分析,我们发现 KV 缓存存在一种根本且此前被忽视的非对称性:虽然相邻键获得相似的注意力权重(即局部同质性),但相邻值表现出明显的异构分布。这种键值非对称性揭示了现有压缩方法将键值统一处理的关键局限。为此,本文提出一种训练-free 压缩框架(AsymKV),结合基于同质性的键合并与经过数学证明的无损值压缩。广泛实验表明,AsymKV 在各种任务和基础模型上均优于现有长上下文方法。例如,在LLaMA3.1-8B上,AsymKV在LongBench上的平均得分达43.95,显著优于HO(38.89)等 SOTA 方法。我们的代码可在链接找到:https://github.com/the-scale-lab/Asymkv。
关键词
引用
@article{arxiv.2506.05410,
title = {Homogeneous Keys, Heterogeneous Values: Exploiting Local KV Cache Asymmetry for Long-Context LLMs},
author = {Wanyun Cui and Mingwei Xu},
journal= {arXiv preprint arXiv:2506.05410},
year = {2025}
}
备注
14 pages,7 figures;Accepted by NeurIPS 2025