LLM-FP4:面向大语言模型的4位浮点量化Transformer
计算与语言
2024-04-30 v1 人工智能
硬件体系结构
计算机视觉与模式识别
摘要
我们提出 LLM-FP4,以训练后量化的方式将大语言模型(LLMs)的权重和激活值均量化为4位浮点数值。现有的训练后量化(PTQ)方案主要基于整数,在低于8位的比特宽度下表现不佳。与整数量化相比,浮点(FP)量化更为灵活,能更好地处理长尾或钟形分布,并且已成为许多硬件平台中的默认选择。FP量化的一个特点是其性能在很大程度上取决于指数位的选择和截断范围。为此,我们通过搜索最优量化参数构建了一个强力的 FP-PTQ 基线。此外,我们观察到激活分布中存在高通道间方差和低通道内方差的模式,这增加了激活量化的难度。我们认识到这种模式在一系列为不同任务设计的 transformer 模型中是一致的,例如 LLMs、BERT 和 Vision Transformer 模型。为了解决这个问题,我们提出逐通道激活量化,并表明这些额外的缩放因子可以重新参数化为权重的指数偏置,带来的开销可忽略不计。我们的方法首次能够将 LLaMA-13B 的权重和激活均量化为仅4位,并在常识零样本推理任务上取得63.1的平均分,仅比全精度模型低5.8分,显著优于先前最优方法12.7分。代码见:https://github.com/nbasyl/LLM-FP4。
引用
@article{arxiv.2310.16836,
title = {LLM-FP4: 4-Bit Floating-Point Quantized Transformers},
author = {Shih-yang Liu and Zechun Liu and Xijie Huang and Pingcheng Dong and Kwang-Ting Cheng},
journal= {arXiv preprint arXiv:2310.16836},
year = {2024}
}
备注
EMNLP 2023 Main Conference