中文

面向解聚 LLM 推理的 SplitZip:无损 KV 压缩

网络与互联网体系结构 2026-05-05 v1 密码学与安全 机器学习 信号处理

摘要

当代服务大语言模型(LLM)的系统已采用预填充-解码解聚设计,以更好地在计算受限的预填充阶段和内存受限的解码阶段之间进行负载均衡。在此设计下,预填充工作进程生成的 KV 缓存必须传输到解码工作进程,才能开始标记生成。当这些工作进程位于不同的物理系统上时,这一传输成为大规模服务 LLM 的显著瓶颈。对于长输入和智能体工作负载,瓶颈尤为突出。现有无损编解码器不适用于此场景,因为它们主要针对离线权重压缩,运行在 CPU 上,或使用可变长编码,其解压快速但压缩速度不足以跟上 KV 产生的速度。我们引入 SplitZip,一种面向 GPU 的 KV 缓存无损压缩器,保留 KV 张量的位级一致性,并可无需修改模型执行即可集成到现有服务框架中。SplitZip 利用 KV 激活浮点指数的冗余性,将最常见的指数值编码为固定长度编码,并将稀有指数通过位置-值稀疏逃逸流传输。经过离线校准的 top-16 指数词典表消除在线直方图计数,而规则稠密路径和稀疏逃逸校正使编码和解码在 GPU 上高效。针对真实 BF16 激活张量,SplitZip 实现 613.3613.3 GB/s 的压缩吞吐量和 2181.82181.8 GB/s 的解压吞吐量,显著优于面向延迟关键路径的先前无损压缩器。在端到端传输实验中,BF16 KV 缓存传输实现最高 1.32×1.32\times 的加速,TTFT(首词时间)加速 1.30×1.30\times,请求吞吐量提升 1.23×1.23\times。该方法同样适用于 FP8 KV 缓存,提供最高 1.14×1.14\times 的压缩比。

关键词

引用

@article{arxiv.2605.01705,
  title  = {Toward Resilient 5G Networks: Comparative Analysis of Federated and Centralized Learning for RF Jamming Detection},
  author = {Samhita Kuili and Mohammadreza Amini and Burak Kantarci},
  journal= {arXiv preprint arXiv:2605.01705},
  year   = {2026}
}

备注

6 pages, 9 figures, accepted to 2026 IEEE International Conference on Cyber Security and Resilience (CSR)