混合量化的比例定律
计算与语言
2025-08-08 v3 机器学习
摘要
后训练量化大型语言模型(LLM)在降低推理内存和计算需求方面已被证明有效。在本研究中,我们聚焦于一个直接的问题:在实现目标准确率或困惑度的低精度量化时,需要保留多少高精度计算,以及随着 LLM 规模扩大,量化需要多细致?我们首先引入两个关键指标,称为量化比率()和量化块大小()。前者衡量的是量化为低精度算术的参数数量,以总参数数标准化;后者定义了在一个块中共享缩放因子的价值数量,类似于 NVIDIA Blackwell 架构中 FP4 格式引入的块大小概念。通过在不同模型和量化方法上进行大量且严格控制的实验,我们提出了一种统一的量化比例定律(PTQ),可预测不同 和 的损失退化。对于 ,我们的比例定律意味着参数比例缩放和比例缩放具有乘法关系。因此,较大的模型更适合更高的量化比率 ,从而支持混合量化在推理中的采用。关于 ,我们的发现表明,类似 Blackwell 中使用的小块大小对大型模型并非必需。使用较小的 反而可能不必要地复杂化硬件电路的设计。
引用
@article{arxiv.2410.06722,
title = {Scaling Laws For Mixed Quantization},
author = {Zeyu Cao and Boyang Gu and Cheng Zhang and Pedro Gimenes and Jianqiao Lu and Jianyi Cheng and Xitong Gao and Yiren Zhao},
journal= {arXiv preprint arXiv:2410.06722},
year = {2025}
}