SkipKV:面向大型推理模型高效推理的KV生成与存储选择性跳过
人工智能
2026-04-21 v2
摘要
大型推理模型(LRMs)通常会产生显著的键值(KV)缓存开销,这是因为其冗长的思维链(CoT)推理导致缓存线性增长。这导致了内存开销和吞吐量瓶颈,限制了高效部署。为了在推理过程中减小KV缓存大小,我们首先研究了现有KV缓存驱逐方法在CoT推理中的有效性。有趣的是,我们发现由于不稳定的逐token评分以及填充导致的KV有效预算减少,最先进(SoTA)的驱逐方法在多批次设置中无法保持准确性。此外,这些方法通常比没有驱逐的原始模型生成更长的序列,因为语义无感知的逐token驱逐会导致推理过程中的重复验证。为了解决这些问题,我们提出了\textbf{SkipKV},一种\textbf{\textit{无需训练}}的KV压缩方法,该方法执行选择性的\textit{驱逐}和\textit{生成},在粗粒度的句子级序列移除上运行,以实现高效的CoT推理。具体来说,它引入了一种\textit{句子评分指标}来识别并移除高度相似的句子,同时保持语义连贯性。为了抑制冗余生成,SkipKV在推理过程中动态调整一个引导向量来更新隐藏激活状态,强制LRM生成简洁的响应。在多个推理基准上的广泛评估表明,在相似的压缩预算下,SkipKV的准确率比基线方法高出高达。此外,与SoTA相比,SkipKV的生成长度缩短了高达,同时吞吐量提高了高达。我们的代码发布于:\href{https://github.com/TTTTTTris/SkipKV}{https://github.com/TTTTTTris/SkipKV}。
引用
@article{arxiv.2512.07993,
title = {SkipKV: Selective Skipping of KV Generation and Storage for Efficient Inference with Large Reasoning Models},
author = {Jiayi Tian and Seyedarmin Azizi and Yequan Zhao and Erfan Baghaei Potraghloo and Sean McPherson and Sharath Nittur Sridhar and Zhengyang Wang and Zheng Zhang and Massoud Pedram and Souvik Kundu},
journal= {arXiv preprint arXiv:2512.07993},
year = {2026}
}