中文

FPTQ:面向大语言模型的细粒度训练后量化

计算与语言 2023-08-31 v1 人工智能 机器学习

摘要

在大规模语言模型时代,庞大的参数规模给部署带来了重大挑战。作为普遍的压缩技术,量化已成为解决此问题的主流做法,主要集中于两种方案 W8A8 和 W4A16(即权重和激活采用此类位宽)。在本研究中,我们针对可用的开源 LLM 提出一种新颖的 W4A8 训练后量化方法,其结合了两种方案的优势。因此,我们可以利用 4 位权重量化在 I/O 利用上的好处以及 8 位矩阵计算带来的加速。然而,W4A8 面临严重的性能退化。作为补救,我们引入了逐层激活量化策略,其针对最棘手的层具有新颖的对数均衡,并将其与细粒度权重量化结合。无需繁复技巧,我们消除了进一步微调的必要性,并在标准基准上于 BLOOM、LLaMA 和 LLaMA-2 上获得了最先进的 W4A8 量化性能。我们确认 W4A8 量化可实现对大语言模型的部署,促进其广泛的现实世界应用。

关键词

引用

@article{arxiv.2308.15987,
  title  = {FPTQ: Fine-grained Post-Training Quantization for Large Language Models},
  author = {Qingyuan Li and Yifan Zhang and Liang Li and Peng Yao and Bo Zhang and Xiangxiang Chu and Yerui Sun and Li Du and Yuchen Xie},
  journal= {arXiv preprint arXiv:2308.15987},
  year   = {2023}
}