中文

CompilerKV:通过离线经验编译实现风险自适应的 KV 压缩

机器学习 2026-05-21 v2 人工智能

摘要

仅预填充的 KV 压缩在预填充结束时冻结一个令牌子集,并从中进行解码,而无需进一步驱逐。因此,保留决策是不可逆的,然而现有方法估计其依赖的校正信号(每头可靠性和提示级压缩敏感性)是从单个有噪声的提示中在线进行的。我们认为这是错误的统计单位:这些信号在跨提示间的规律性远高于提示内的信噪比。我们引入了 \textsc{CompilerKV},一种 KV 保留策略,其校正表是从校准语料库中离线编译的,将标准观察窗口扫描后的在线校正减少到 O(1)O(1) 次查找加上一个预算限制。我们发现编译后的保留表表现为可移植的架构先验:在四个骨干网络上,排名可跨不相关语料库转移(平均 Spearman ρˉ=0.90\bar\rho{=}0.90),并且直接的模型到模型表格转移平均仅损失 0.40.4--0.80.8 个 LongBench 分数。在 512 令牌预算下,\textsc{CompilerKV} 在所有四个骨干网络上达到了压缩 SOTA,比最强的仅预填充基线平均提高了 +1.67+1.67 分(任务自举 95% 置信区间 [+1.08,+2.37][+1.08,+2.37])。压力机制放大了差距:在固定的 512/32k512/32k 缓存比率下,CompilerKV 在 128k RULER 上仍然是最强的压缩方法( ⁣73\sim\!73 vs. FullKV  ⁣79\sim\!79,SnapKV  ⁣38\sim\!38);在 32k NIAH 上达到 0.890.89 vs. SnapKV 0.420.42;并且在 32k 输入下,仅保留 1.56%1.56\% 的预填充 KV,批量大小为 16 的服务仍然可行,而 FullKV 则内存不足(OOM)。

关键词

引用

@article{arxiv.2602.08686,
  title  = {CompilerKV: Risk-Adaptive KV Compression via Offline Experience Compilation},
  author = {Ning Yang and Chengzhi Wang and Yibo Liu and Baoliang Tian and Haijun Zhang},
  journal= {arXiv preprint arXiv:2602.08686},
  year   = {2026}
}