中文

Q8BERT:8位量化 BERT

计算与语言 2021-12-20 v2 机器学习

摘要

近年来,基于预训练 Transformer 的语言模型(如 BERT 和 GPT)在许多自然语言处理(NLP)任务中表现出显著改进。然而,这些模型包含大量参数。GPT2 和 Megatron 等更大且更精确模型的出现,表明大预训练 Transformer 模型是一种趋势。然而,在生产环境中使用这些大模型是一项复杂任务,需要大量的计算、内存和功耗资源。在本工作中,我们展示了如何在 BERT 微调阶段执行量化感知训练,从而以最小的精度损失将 BERT 压缩 4×4\times。此外,若针对支持 8bit 整数的硬件进行优化,所生成的量化模型可加速推理速度。

关键词

引用

@article{arxiv.1910.06188,
  title  = {Q8BERT: Quantized 8Bit BERT},
  author = {Ofir Zafrir and Guy Boudoukh and Peter Izsak and Moshe Wasserblat},
  journal= {arXiv preprint arXiv:1910.06188},
  year   = {2021}
}

备注

5 Pages, Accepted at the 5th Workshop on Energy Efficient Machine Learning and Cognitive Computing - NeurIPS 2019