中文

PolyKV:面向多智能体 LLM 推理的共享非对称压缩 KV 缓存池

机器学习 2026-04-29 v1 计算与语言 分布式、并行与集群计算

摘要

我们提出了 PolyKV,一种多并发推理智能体共享单个非对称压缩 KV 缓存池的系统。不同于传统做法为每个智能体单独分配 KV 缓存,PolyKV 只需对压缩缓存进行一次写入,即可通过 HuggingFace DynamicCache 对象注入到 N 个独立的智能体上下文中。压缩方式为非对称:键(Key)采用 int8(q8_0)量化以保持 softmax 稳定性,而值(Value)则使用 TurboQuant MSE 压缩——即先进行快速沃尔哈赫变换(FWHT)旋转,再进行 3 位 Lloyd-Max 量化,量化中心经调优后服从 N(0,1) 分布。我们在两种模型规模(SmolLM2-1.7B-Instruct 与 Llama-3-8B-Instruct)、三个上下文长度(600-7,194 token)以及最多 15 个并发智能体的配置下进行评估。PolyKV 在所有配置下均实现稳定的 2.91 倍压缩比。实验表明,在 Llama-3-8B 且 15 个智能体共享 4K token 上下文时,PolyKV 将 KV 缓存内存从 19.8 GB 降至 0.45 GB,降幅达 97.7%,同时仅引入 +0.57% 的 perplexity 退化,平均 BERTScore F1 为 0.928。PPL 增量随智能体数量不增长,且随上下文长度增加而改善,在 1,851 个连贯 token 时甚至逆转为 -0.26%。据我们所知,目前尚无任何前期工作将单一共享的有损压缩 KV 池与多读取者并发智能体访问相结合。

关键词

引用

@article{arxiv.2604.24971,
  title  = {PolyKV: A Shared Asymmetrically-Compressed KV Cache Pool for Multi-Agent LLM Inference},
  author = {Ishan Patel and Ishan Joshi},
  journal= {arXiv preprint arXiv:2604.24971},
  year   = {2026}
}

备注

10 pages, 6 tables. Code: https://github.com/ishan1410/PolyKV Keywords: KV cache compression, multi-agent LLM inference, asymmetric quantization, FWHT, TurboQuant, shared memory