中文

用于KV缓存压缩的Hurwitz四元数乘法量化

机器学习 2026-05-28 v1 人工智能

摘要

我们提出\textbf{Hurwitz四元数乘法量化(HQMQ)},一种用于大型语言模型KV缓存压缩的\textbf{免校准}方法。HQMQ将K或V的每个4元素块视为一个四元数,并将其单位方向量化为乘积qpqsq_p \cdot q_s,其中qpq_p取自24元素Hurwitz群2T2TS3S^3上24-cell的24个顶点,两两夹角6060^\circ),qsq_s取自每个(层,头)的二级码本,包含SS个\textemph{随机}单位四元数。这种乘法组合在SS个存储参数下产生24S24S个有效码字;随机初始化就足够了,因为左乘是S3S^3等距变换,因此种子码本在最终任务困惑度上的变化小于1.5%1.5\%。一个每批次的中间值乘数离群值提取步骤(C=3C{=}3,无校准)处理了现代离群值密集的架构。我们在五个现代开源模型上进行了评估:Mistral-7B(密集MHA)、Llama-3-8B和Qwen2.5-7B以及Qwen3-8B(密集GQA),以及gpt-oss-20b(稀疏MoE)。在Mistral-7B和Qwen3-8B上,HQMQ在约5比特下与fp16的差距在0.02至0.03个困惑度点以内。在Qwen2.5-7B和Qwen3-8B上,朴素int4会崩溃至104+10^4{+}困惑度,而HQMQ + Med3×\times在约5比特下将fp16质量恢复在0.02至0.10个困惑度点以内。在所有五个模型上,HQMQ在匹配比特数下以3至1900倍的幅度帕累托优于朴素int。在Mistral上,3.79比特的下游零样本准确率与fp16相当。与最强的校准KV量化基线相比,3.79比特的HQMQ在CoQA上匹配KIVI-4(约4.5比特)的差距在约1个百分点以内,在TruthfulQA上为0.6个百分点,在GSM8K上为2.3个百分点,同时比特数减少16%且无需校准过程。在存储层面,HQMQ实现了高达5.05倍的KV压缩,将Llama-3-70B的128k上下文缓存从43 GB缩小到8.5 GB。

关键词

引用

@article{arxiv.2605.27646,
  title  = {Hurwitz Quaternion Multiplicative Quantization for KV Cache Compression},
  author = {Kabir Swain and Sijie Han and Daniel Karl I. Weidele and Mauro Martino and David Cox and Antonio Torralba},
  journal= {arXiv preprint arXiv:2605.27646},
  year   = {2026}
}