MKQ-BERT:权重与激活均为 4-bit 量化的 BERT
机器学习
2022-03-28 v1
摘要
近来,基于预训练 Transformer 的语言模型(如 BERT)在许多自然语言处理(NLP)任务中展现出相对于传统方法的巨大优越性。然而,在资源受限设备上部署这些模型的计算成本令人望而却步。缓解此计算开销的一种方法是先将原始模型量化为更少比特的表示,先前工作已证明我们最多可将 BERT 的权重和激活均量化为 8-bit 而不损其性能。本工作中,我们提出 MKQ-BERT,进一步提升了压缩水平并使用 4-bit 进行量化。在 MKQ-BERT 中,我们提出了一种计算量化尺度梯度的新方法,并结合一种先进的知识蒸馏策略。一方面,我们证明在相同压缩水平下,MKQ-BERT 以更高精度优于现有 BERT 量化方法。另一方面,我们是首个成功部署 4-bit BERT 并实现端到端推理加速的工作。我们的结果表明,在不降低模型精度的情况下可实现 5.3 倍的比特缩减,且基于 Transformer 的模型中一个 int4 层的推理速度比 float32 层快 15 倍。
引用
@article{arxiv.2203.13483,
title = {MKQ-BERT: Quantized BERT with 4-bits Weights and Activations},
author = {Hanlin Tang and Xipeng Zhang and Kai Liu and Jianchen Zhu and Zhanhui Kang},
journal= {arXiv preprint arXiv:2203.13483},
year = {2022}
}