中文

eOptShrinkQ:基于最优谱去噪与量化的近无损KV缓存压缩

机器学习 2026-05-06 v1 信息论 math.IT

摘要

我们指出,transformer注意力头中的键值(KV)缓存可以自然分解为低秩的shared context组件和full-rank的per-token残差,由spiked random matrix model(脉冲随机矩阵模型)良好描述。这一观察导致eOptShrinkQ,一个两阶段压缩管道:optimal singular value shrinkage(eOptShrink)自动提取共享结构,而残差——满足thin shell property(薄壳性质)且坐标为delocalized(去局部化)——由TurboQuant进行量化,该方法是一种最近提出的per-vector标量量化器,具有近最优失真保证。通过恢复标量量化所假设的各向同性,spectral denoising消除了对异常值处理和专用内积偏差校正的需求,为改进重建留下了这些比特。随机矩阵理论的理论依据提供了三项保证:通过BBP相位转移实现自动秩选择,确保残差上近乎为零的内积偏差,以及坐标去局部化确保近最优量化失真。我们在Llama-3.1-8B和Ministral-8B上对eOptShrinkQ进行了实验,验证了其在三个层次:per-head MSE和内积保真度,其中eOptShrinkQ在相当于质量相当的情况下比TurboQuant每项节省近1比特;end-to-end LongBench(16项任务),其中eOptShrinkQ在约2.2比特/项时超过TurboQuant的3.0比特;以及多针索取,eOptShrinkQ在2.2比特时几乎匹配或超过未压缩的FP16,表明谱去噪可以作为检索密集型任务的有益正则化器。

关键词

引用

@article{arxiv.2605.02905,
  title  = {eOptShrinkQ: Near-Lossless KV Cache Compression Through Optimal Spectral Denoising and Quantization},
  author = {Pei-Chun Su},
  journal= {arXiv preprint arXiv:2605.02905},
  year   = {2026}
}