中文

VeriCache: 将有损 KV 缓存转化为无损 LLM 推理

硬件体系结构 2026-05-19 v1 机器学习

摘要

KV 缓存的庞大尺寸已成为 serving LLM 时上下文长度不断增长的主要瓶颈。为此,已提出许多 KV 缓存压缩方法,如 token dropping 和量化。然而,这些方法几乎全部是有损的——尽管对短输出几乎没有精度下降,但随着解码更多 token,输出与完整 KV 缓存输出的差异日益扩大,这会导致代码生成和工具调用出现灾难性失败。我们提出 VeriCache,这是第一个确保与完整 KV 缓存解码相同输出的推理框架,同时大幅保留了各种 KV 缓存压缩算法高解码吞吐量。VeriCache 使用压缩后的 KV 缓存进行草稿 token,然后与完整 KV 缓存进行验证。虽然这听起来仅是 speculative decoding,但 VeriCache 仍需解决一个关键系统挑战——在 GPU 内存中保持完整 KV 缓存不在场,并最小化交换它进行验证的开销。该方法的洞见有两点:(1) 压缩 KV 解码可以与完整 KV 交换并行,因为前者受 HBM 带宽限制,后者受 PCIe/网络带宽限制;(2) 压缩 KV 缓存常常产生与完整 KV 缓存相似的输出,允许更长的草稿 horizon 以摊薄每次完整 KV 交换开销。VeriCache 可用于长上下文解码和远程前缀缓存,支持通过统一压缩器接口适用于各种 token-dropping 和量化方法,并可与传统 speculative decoding 组合。实验结果表明,VeriCache 在生成相同输出的同时,比完整 KV 推理提高了最高可达 4 倍的吞吐量。

关键词

引用

@article{arxiv.2605.17613,
  title  = {VeriCache: Turning Lossy KV Cache into Lossless LLM Inference},
  author = {Jiayi Yao and Samuel Shen and Kuntai Du and Shaoting Feng and Dongjoo Seo and Rui Zhang and Yuyang Huang and Yuhan Liu and Shan Lu and Junchen Jiang},
  journal= {arXiv preprint arXiv:2605.17613},
  year   = {2026}
}