中文

FibQuant:面向随机访问 KV 缓存压缩的通用向量量化

人工智能 2026-05-13 v1 信息论 math.IT 机器学习

摘要

长上下文推理日益成为一个内存流量问题。其关键在于键值(KV)缓存:它随上下文长度、批次大小、层数和头数增长,并在每个解码步骤被读取。基于旋转的标量编解码器通过存储范数、应用共享随机旋转并逐坐标量化来满足这一系统约束。它们是通用的且支持随机访问,但丢弃了归一化步骤所创建的几何结构。在 Haar 旋转之后,kk 个连续坐标的块并非乘积源;它是单位球上的球面 Beta 源。我们引入了 \textsc{FibQuant},一种通用的固定速率向量量化器,它保持了相同的归一化-旋转-存储接口,同时用与该规范源匹配的共享径向-角度码本替换了标量表。该码本结合了 Beta 分位数半径、Fibonacci/Roberts-Kronecker 拟均匀方向以及多重重启 Lloyd-Max 精炼。我们证明,在匹配速率下,由此产生的向量码严格优于其标量积特化,其高码率增益可分解为胞腔成形因子和密度匹配因子。相同的构造提供了一个密集的码率轴,包括分数比特和亚一比特工作点,无需校准或可变长度地址。在 GPT-2 小模型的 KV 缓存上,\text{QuantFibQuant} 描绘了一条从 5×5\times 压缩(注意力余弦相似度为 0.990.99)到 34×34\times 压缩(相似度为 0.950.95)的内存-保真度前沿。在 TinyLlama-1.1B 上进行端到端测试,在 4×4\times 压缩下,其困惑度与 fp16 相差在 0.100.10 以内,并且在 b=2b = 28×8\times 压缩)时,其困惑度比标量 \textsc{TurboQuant} 低 3.6×3.6\times,此时标量随机访问量化开始失效。

关键词

引用

@article{arxiv.2605.11478,
  title  = {FibQuant: Universal Vector Quantization for Random-Access KV-Cache Compression},
  author = {Namyoon Lee and Yongjune Kim},
  journal= {arXiv preprint arXiv:2605.11478},
  year   = {2026}
}

备注

15 pages