ZeroQuant:面向大规模Transformer的高效且低成本训练后量化方法
计算与语言
2022-06-07 v1 机器学习
摘要
如何在实际中高效服务不断增大的已训练自然语言模型,即使对强大的云服务器而言也因惊人的内存/计算需求而变得极具挑战。在本工作中,我们提出一种高效且可负担的训练后量化方法来压缩基于大型 Transformer 的模型,称为 ZeroQuant。ZeroQuant 是一个端到端量化与推理流水线,包含三个主要组件:(1)面向硬件的细粒度权重与激活量化方案;(2)一种新颖的低成本逐层知识蒸馏算法(LKD),即便无法访问原始训练数据也可使用;(3)高度优化的量化系统后端支持以消除量化/反量化开销。由此我们能够表明:(1)ZeroQuant 能以无代价方式将 BERT 和 GPT3 风格模型的权重与激活精度降至 INT8,且精度影响极小,相比 FP16 推理在这些模型上分别实现高达 5.19x/4.16x 加速;(2)ZeroQuant 加 LKD 以可负担方式将全连接模块权重量化为 INT4,同时注意力模块权重为 INT8、激活为 INT8,相比 FP16 模型实现 3 倍内存占用缩减;(3)ZeroQuant 可直接应用于两个最大的开源语言模型,包括 GPT-J6B 和 GPT-NeoX20,我们的 INT8 模型取得与 FP16 模型相近的精度,但效率提升高达 5.2 倍。
引用
@article{arxiv.2206.01861,
title = {ZeroQuant: Efficient and Affordable Post-Training Quantization for Large-Scale Transformers},
author = {Zhewei Yao and Reza Yazdani Aminabadi and Minjia Zhang and Xiaoxia Wu and Conglong Li and Yuxiong He},
journal= {arXiv preprint arXiv:2206.01861},
year = {2022}
}
备注
11 pages, 4 figures