量化为免费: 基于 Apple Silicon 的 int4 KV 缓存超越 fp16
性能
2026-05-08 v1 人工智能
摘要
我们将 KV 缓存量化问题框架化为质量-延迟权衡, 但在 Apple Silicon 的统一内存架构下, 该权衡被颠倒: 单个融合 Metal 内核 (sign-randomized FFT + per-channel + per-group abs-max + int4 nibble pack), 以 HuggingFace \texttt{Cache} 子类的形式暴露, 在 Gemma-3 1B (- token 前缀) 和 Qwen2.5-1.5B (短上下文) 上均跑得比 fp16 更快 ( 到 ms/token), 实现了 持久化内存压缩且质量得益 ( Qwen 短提示; Gemma 中 hook )。该内核的 \,ns/vec 开销低于 压缩带来的带宽节省。融合内核还关闭了 Qwen 的 4 位 per-token 灾难 (, 降低 ) 在 \,GFLOPS / 。支持性发现: 和 在 KV 质量上统计上无显著差异(我们选 以适配混合进制和矩阵乘法);学习旋转消融实验揭示了固定随机 SRFT 基的正则化作用(学习 而不使用 SRFT 时, 校准 MSE 降至 对比 ,但得分更差);在 时, 的 Householder 旋转实际上无损。
引用
@article{arxiv.2605.05699,
title = {When Quantization Is Free: An int4 KV Cache That Outruns fp16 on Apple Silicon},
author = {Mohamed Amine Bergach},
journal= {arXiv preprint arXiv:2605.05699},
year = {2026}
}