整数还是浮点?大型语言模型低位量化的新视角
机器学习
2023-05-23 v1 人工智能
摘要
大型语言模型(LLMs)的高效部署需要低位量化以最小化模型大小和推理成本。虽然低位整数格式(例如 INT8/INT4)一直是传统选择,但新兴的低位浮点格式(例如 FP8/FP4)提供了一种引人注目的替代方案,并正获得诸如 NVIDIA H100 GPU 等尖端硬件的支持。然而,对于 LLMs 的量化,低位 INT 与 FP 格式的优越性仍不明确。在本研究中,我们对相同位宽的 INT 和 FP 量化进行了比较分析,揭示了由于张量分布的复杂性和多样性,最优量化格式在不同层之间有所不同。因此,我们提倡混合格式量化(MoFQ),该方法在逐层基础上选择最优格式。这种简单而有效的方法在 LLaMA 模型的各种任务测试中,于仅权重量化(W-only)和权重-激活量化(WA)两种训练后量化场景下均取得了最先进的结果。在 4 位 W-only 量化中,MoFQ 无需复杂的超参数调优,且量化速度快一个数量级,性能超越了 GPTQ。而在 8 位 WA 量化中,MoFQ 显著优于仅使用 INT 或 FP 的方法,实现了接近全精度模型的性能。值得注意的是,与仅使用 INT 或 FP 的量化相比,MoFQ 不会产生额外的硬件开销,因为位宽保持不变。
引用
@article{arxiv.2305.12356,
title = {Integer or Floating Point? New Outlooks for Low-Bit Quantization on Large Language Models},
author = {Yijia Zhang and Lingran Zhao and Shijie Cao and Wenqiang Wang and Ting Cao and Fan Yang and Mao Yang and Shanghang Zhang and Ningyi Xu},
journal= {arXiv preprint arXiv:2305.12356},
year = {2023}
}