OScaR:面向LLM及更广范围的极端KV缓存量化的奥斯卡之锐
机器学习
2026-05-20 v1 计算与语言
摘要
向长程推理和多模态智能的快速发展,使得Key-Value(KV)缓存的内存占用成为高效部署的主要瓶颈。虽然基于per-channel量化的方法能够有效应对Key张量中固有的通道级异常值,但在极端压缩情况下,其效能会下降。本文从经验和理论两个角度,重新审视了per-channel量化范式的内在局限性。我们的分析识别出标记范不平衡(TNI)为量化保真度的主要瓶颈。我们展示,TNI在共享量化参数需跨越标志组时,会系统性放大误差。与依赖复杂量化管道(如TurboQuant)不同,我们提出OScaR(Omni-Scaled Canalized Rotation),一个用于X-LLMs(即文本型、多模态和全模态LLMs)的准确且轻量级KV缓存压缩框架。 advances the per-channel范式,OScaR采用Canalized Rotation followed by Omni-Token Scaling来有效且高效地缓解TNI引起的序列维度方差,进一步通过优化的系统设计和CUDA内核得到支持。广泛的评估表明,OScaR在X-LLMs上始终优于现有方法,在INT2量化下实现接近无损性能,构建了一个稳健、低复杂度且通用的框架,定义了新的Pareto前沿。与BF16 FlashDecoding-v2基线相比,我们的OScaR实现在解码方面实现最高可达3.0倍加速,内存占用降低5.3倍,吞吐量提升4.1倍。OScaR的代码已公开发布于https://github.com/ZunhaiSu/OScaR-KV-Quant。
引用
@article{arxiv.2605.19660,
title = {OScaR: The Occam's Razor for Extreme KV Cache Quantization in LLMs and Beyond},
author = {Zunhai Su and Rui Yang and Chao Zhang and Yaxiu Liu and Yifan Zhang and Wei Wu and Jing Xiong and Dayou Du and Xialie Zhuang and Yulei Qian and Yuchen Xie and Yik-Chung Wu and Hongxia Yang and Ngai Wong},
journal= {arXiv preprint arXiv:2605.19660},
year = {2026}
}
备注
Under review