中文

SmoothQuant+:面向 LLM 的精确高效 4-bit 训练后权重量化

机器学习 2023-12-08 v1 计算与语言

摘要

大型语言模型(LLM)在各种任务中展现出了卓越的能力。然而,其庞大的模型规模以及随之而来的对计算和内存资源的需求也给模型部署带来了挑战。目前,4-bit 训练后量化(PTQ)在 LLM 中取得了一定成功,与 FP16 模型相比减少了约 75% 的内存占用,尽管存在一定的精度损失。在本文中,我们提出了 SmoothQuant+,一种精确且高效的 4-bit 仅权重 PTQ 方法,无需额外训练,首次实现了 LLM 的无损精度。基于权重量化损失被激活异常值放大的事实,SmoothQuant+ 在量化前按通道平滑激活异常值,同时调整相应权重以实现数学等价,然后对线性层进行分组 4-bit 权重量化。我们已将 SmoothQuant+ 集成到 vLLM 框架(一个专为 LLM 开发的高级高吞吐量推理引擎)中,并为其配备了高效的 W4A16 CUDA 内核,使 vLLM 能够无缝支持 SmoothQuant+ 4-bit 权重量化。我们的结果表明,借助 SmoothQuant+,Code Llama-34B 模型可以量化并部署在单张 A100 40GB GPU 上,实现无损精度,且与部署在两张 A100 40GB GPU 上的 FP16 模型相比,吞吐量提升了 1.9 至 4.0 倍。此外,每个 token 的延迟仅为部署在两张 A100 40GB GPU 上的 FP16 模型的 68%。据我们所知,这是目前 LLM 领域最先进的 4-bit 权重量化方法。

关键词

引用

@article{arxiv.2312.03788,
  title  = {SmoothQuant+: Accurate and Efficient 4-bit Post-Training WeightQuantization for LLM},
  author = {Jiayi Pan and Chengcan Wang and Kaifu Zheng and Yangguang Li and Zhenyu Wang and Bin Feng},
  journal= {arXiv preprint arXiv:2312.03788},
  year   = {2023}
}