中文

量化为免费: 基于 Apple Silicon 的 int4 KV 缓存超越 fp16

性能 2026-05-08 v1 人工智能

摘要

我们将 KV 缓存量化问题框架化为质量-延迟权衡, 但在 Apple Silicon 的统一内存架构下, 该权衡被颠倒: 单个融合 Metal 内核 (sign-randomized FFT + per-channel λ\lambda + per-group abs-max + int4 nibble pack), 以 HuggingFace \texttt{Cache} 子类的形式暴露, 在 Gemma-3 1B (256256-40964096 token 前缀) 和 Qwen2.5-1.5B (短上下文) 上均跑得比 fp16 更快 (3-38%-8\% ms/token), 实现了 3×3\times 持久化内存压缩且质量得益 (\dPPL=0.000\dPPL = 0.000 Qwen 短提示; Gemma 中 +3.6+3.6 hook \dPPL\dPPL)。该内核的  ⁣25\sim\!25\,ns/vec 开销低于 3×3\times 压缩带来的带宽节省。融合内核还关闭了 Qwen 的 4 位 per-token 灾难 (\dPPL=+7975+638.6\dPPL = +7975 \to +638.6, 降低 12.5×12.5\times) 在 182182\,GFLOPS / D=128D{=}128。支持性发现: \SRFT\SRFT\SRHT\SRHT 在 KV 质量上统计上无显著差异(我们选 \SRFT\SRFT 以适配混合进制和矩阵乘法);学习旋转消融实验揭示了固定随机 SRFT 基的正则化作用(学习 R+λR+\lambda 而不使用 SRFT 时, 校准 MSE 降至 84.9%84.9\% 对比 50.3%50.3\%,但得分更差);在 d=256d{=}256 时, k=d/2k{=}d/2 的 Householder 旋转实际上无损。

关键词

引用

@article{arxiv.2605.05699,
  title  = {When Quantization Is Free: An int4 KV Cache That Outruns fp16 on Apple Silicon},
  author = {Mohamed Amine Bergach},
  journal= {arXiv preprint arXiv:2605.05699},
  year   = {2026}
}