中文

混合量化的比例定律

计算与语言 2025-08-08 v3 机器学习

摘要

后训练量化大型语言模型(LLM)在降低推理内存和计算需求方面已被证明有效。在本研究中,我们聚焦于一个直接的问题:在实现目标准确率或困惑度的低精度量化时,需要保留多少高精度计算,以及随着 LLM 规模扩大,量化需要多细致?我们首先引入两个关键指标,称为量化比率(QrQ_r)和量化块大小(QbQ_b)。前者衡量的是量化为低精度算术的参数数量,以总参数数标准化;后者定义了在一个块中共享缩放因子的价值数量,类似于 NVIDIA Blackwell 架构中 FP4 格式引入的块大小概念。通过在不同模型和量化方法上进行大量且严格控制的实验,我们提出了一种统一的量化比例定律(PTQ),可预测不同 QrQ_rQbQ_b 的损失退化。对于 QrQ_r,我们的比例定律意味着参数比例缩放和比例缩放具有乘法关系。因此,较大的模型更适合更高的量化比率 QrQ_r,从而支持混合量化在推理中的采用。关于 QbQ_b,我们的发现表明,类似 Blackwell 中使用的小块大小对大型模型并非必需。使用较小的 QbQ_b 反而可能不必要地复杂化硬件电路的设计。

关键词

引用

@article{arxiv.2410.06722,
  title  = {Scaling Laws For Mixed Quantization},
  author = {Zeyu Cao and Boyang Gu and Cheng Zhang and Pedro Gimenes and Jianqiao Lu and Jianyi Cheng and Xitong Gao and Yiren Zhao},
  journal= {arXiv preprint arXiv:2410.06722},
  year   = {2025}
}