中文

CompressKV:语义检索头在生成前了解哪些 token 不重要

计算与语言 2025-08-05 v1 人工智能

摘要

最近的大型语言模型(LLM)技术显著提升了长上下文处理能力,但不断增长的 key-value(KV)缓存规模对内存和执行效率构成严峻挑战。大多数KV缓存压缩方法依赖于基于分组查询注意力(GQA)的LLM中所有注意力头的启发式token驱逐策略。该方法忽略了注意力头的不同功能,导致关键token被驱逐,从而降低LLM性能。为解决上述问题,我们首先识别出每层中既能检索提示的初始和最终token,又能检索文本中重要token并注意其周围语义上下文的注意力头。随后,我们利用这些头来确定重要token并保留其对应的KV缓存对。进一步,我们对每层的缓存驱逐误差进行分析,引入基于层的自适应KV缓存分配策略。实验结果表明,所提出的CompressKV在LongBench和Needle-in-a-Haystack基准测试的 various 内存预算下 consistently 优于最先进的方法。我们的代码已公开:https://github.com/TUDa-HWAI/CompressKV.git。

关键词

引用

@article{arxiv.2508.02401,
  title  = {CompressKV: Semantic Retrieval Heads Know What Tokens are Not Important Before Generation},
  author = {Xiaolin Lin and Jingcun Wang and Olga Kondrateva and Yiyu Shi and Bing Li and Grace Li Zhang},
  journal= {arXiv preprint arXiv:2508.02401},
  year   = {2025}
}