CompilerKV:通过离线经验编译实现风险自适应的 KV 压缩
机器学习
2026-05-21 v2 人工智能
摘要
仅预填充的 KV 压缩在预填充结束时冻结一个令牌子集,并从中进行解码,而无需进一步驱逐。因此,保留决策是不可逆的,然而现有方法估计其依赖的校正信号(每头可靠性和提示级压缩敏感性)是从单个有噪声的提示中在线进行的。我们认为这是错误的统计单位:这些信号在跨提示间的规律性远高于提示内的信噪比。我们引入了 \textsc{CompilerKV},一种 KV 保留策略,其校正表是从校准语料库中离线编译的,将标准观察窗口扫描后的在线校正减少到 次查找加上一个预算限制。我们发现编译后的保留表表现为可移植的架构先验:在四个骨干网络上,排名可跨不相关语料库转移(平均 Spearman ),并且直接的模型到模型表格转移平均仅损失 -- 个 LongBench 分数。在 512 令牌预算下,\textsc{CompilerKV} 在所有四个骨干网络上达到了压缩 SOTA,比最强的仅预填充基线平均提高了 分(任务自举 95% 置信区间 )。压力机制放大了差距:在固定的 缓存比率下,CompilerKV 在 128k RULER 上仍然是最强的压缩方法( vs. FullKV ,SnapKV );在 32k NIAH 上达到 vs. SnapKV ;并且在 32k 输入下,仅保留 的预填充 KV,批量大小为 16 的服务仍然可行,而 FullKV 则内存不足(OOM)。
引用
@article{arxiv.2602.08686,
title = {CompilerKV: Risk-Adaptive KV Compression via Offline Experience Compilation},
author = {Ning Yang and Chengzhi Wang and Yibo Liu and Baoliang Tian and Haijun Zhang},
journal= {arXiv preprint arXiv:2602.08686},
year = {2026}
}