中文

ZeroQuant(4+2):以面向多样生成任务的全新 FP6 中心策略重新定义 LLM 量化

计算与语言 2023-12-19 v2 机器学习

摘要

本研究检验了大型语言模型(LLM)中如 GPTQ 等 4-bit 量化方法,突出了 GPTQ 的过拟合问题及其在零样本(Zero-Shot)任务中的有限提升。虽然先前的工作仅关注零样本测量,我们将任务范围扩展至更多生成类别,如代码生成和摘要生成,其中我们发现 INT4 量化可能表现显著不佳。然而,由于当前 AI 硬件缺乏成熟的集成和系统加速策略导致性能不佳,简单地转向如 FP6 等更高精度格式一直极具挑战性,因此被忽视。我们的结果表明,FP6 即使采用粗粒度量化方案,在各种算法和任务中均表现稳健,展现了其在准确性和多功能性方面的优越性。值得注意的是,采用 FP6 量化后,\codestar-15B 模型在代码生成中的表现与其 FP16 对应版本相当,而对于如 406M 等较小模型,其在摘要生成中紧密匹配其基线。这些都是 INT4 无法实现的。为了更好地适配各种 AI 硬件并实现最佳系统性能,我们提出了一种新颖的 FP6 4+2 设计,以实现与最先进的 INT4 细粒度量化相似的延迟。通过我们的设计,FP6 可以成为当前 LLM 中使用的 4-bit 量化方法的一个有前景的解决方案。

关键词

引用

@article{arxiv.2312.08583,
  title  = {ZeroQuant(4+2): Redefining LLMs Quantization with a New FP6-Centric Strategy for Diverse Generative Tasks},
  author = {Xiaoxia Wu and Haojun Xia and Stephen Youn and Zhen Zheng and Shiyang Chen and Arash Bakhtiari and Michael Wyatt and Reza Yazdani Aminabadi and Yuxiong He and Olatunji Ruwase and Leon Song and Zhewei Yao},
  journal= {arXiv preprint arXiv:2312.08583},
  year   = {2023}
}