LLM-QAT:面向大语言模型的无数据量化感知训练
计算与语言
2023-05-30 v1
摘要
多种训练后量化方法已应用于大语言模型 (LLMs),并已被证明在 8 比特下表现良好。我们发现这些方法在更低比特精度下失效,并研究了面向 LLMs 的量化感知训练 (LLM-QAT) 以进一步推进量化水平。我们提出一种无数据蒸馏方法,利用预训练模型生成的输出来更好地保留原始输出分布,并允许对任意生成式模型进行量化而不依赖其训练数据,类似于训练后量化方法。除量化权重和激活值外,我们还量化 KV 缓存,这对于在当前模型规模下提升吞吐量和支持长序列依赖至关重要。我们在 7B、13B 和 30B 规模的 LLaMA 模型上以低至 4 比特的量化水平进行实验,观察到相较无训练方法的显著提升,尤其在低比特设置下。
引用
@article{arxiv.2305.17888,
title = {LLM-QAT: Data-Free Quantization Aware Training for Large Language Models},
author = {Zechun Liu and Barlas Oguz and Changsheng Zhao and Ernie Chang and Pierre Stock and Yashar Mehdad and Yangyang Shi and Raghuraman Krishnamoorthi and Vikas Chandra},
journal= {arXiv preprint arXiv:2305.17888},
year = {2023}
}