Q8BERT:8位量化 BERT
计算与语言
2021-12-20 v2 机器学习
摘要
近年来,基于预训练 Transformer 的语言模型(如 BERT 和 GPT)在许多自然语言处理(NLP)任务中表现出显著改进。然而,这些模型包含大量参数。GPT2 和 Megatron 等更大且更精确模型的出现,表明大预训练 Transformer 模型是一种趋势。然而,在生产环境中使用这些大模型是一项复杂任务,需要大量的计算、内存和功耗资源。在本工作中,我们展示了如何在 BERT 微调阶段执行量化感知训练,从而以最小的精度损失将 BERT 压缩 。此外,若针对支持 8bit 整数的硬件进行优化,所生成的量化模型可加速推理速度。
引用
@article{arxiv.1910.06188,
title = {Q8BERT: Quantized 8Bit BERT},
author = {Ofir Zafrir and Guy Boudoukh and Peter Izsak and Moshe Wasserblat},
journal= {arXiv preprint arXiv:1910.06188},
year = {2021}
}
备注
5 Pages, Accepted at the 5th Workshop on Energy Efficient Machine Learning and Cognitive Computing - NeurIPS 2019