SCOPE:优化长上下文生成中的键值缓存压缩
计算与语言
2025-06-04 v3
摘要
对于长上下文生成,键值(KV)缓存已成为 LLM 的瓶颈。尽管该领域已有大量研究,但对解码阶段的优化通常被忽视。然而,基于以下两个观察,我们认为这种优化至关重要,特别是对于长输出生成任务: 预填充阶段的过度压缩需要特定的完整上下文,这会损害对推理任务的理解; 在具有长输出的推理任务中会出现重权值点的偏移。因此,我们引入了 SCOPE,一个简单而高效的框架,分别在预填充和解码阶段进行 KV 缓存优化。具体而言,预填充阶段的 KV 缓存被保留以维持基本信息,同时提出了一种基于滑动的新策略来为解码阶段选择关键的重权值点。使用自适应和非连续策略进一步优化了内存使用和内存传输。在 LongGenBench 上的大量实验表明了 SCOPE 的有效性和泛化能力,及其作为其他仅预填充 KV 压缩方法插件的兼容性。
引用
@article{arxiv.2412.13649,
title = {SCOPE: Optimizing Key-Value Cache Compression in Long-context Generation},
author = {Jialong Wu and Zhenglin Wang and Linhai Zhang and Yilong Lai and Yulan He and Deyu Zhou},
journal= {arXiv preprint arXiv:2412.13649},
year = {2025}
}
备注
ACL 2025