Transformer 神经机器翻译模型的高效 8 位量化
机器学习
2019-06-10 v2
摘要
本工作中,我们利用最新 Intel Xeon Cascade Lake 处理器中的 INT8/VNNI 指令对训练好的 Transformer 机器翻译模型进行量化,以在精度下降小于 0.5 的前提下提升推理性能。据我们所知,这是业界首次尝试量化 Transformer 模型。此举影响重大,因其清晰展示了量化语言翻译模型的多种复杂性。我们提出直接在 TensorFlow 中的新颖量化技术,以适时将 32 位浮点(FP32)计算替换为 8 位整数(INT8)并转换 FP32 计算图。我们还提出一种装箱并行批处理技术以最大化 CPU 利用率。总体而言,我们基于 INT8/VNNI 的优化相较最佳 FP32 性能带来 1.5 倍提升。此外,其揭示了提升量化深度学习推理性能的机遇与挑战,并确立了在 Intel CPU 上高效推理的最佳实践。
引用
@article{arxiv.1906.00532,
title = {Efficient 8-Bit Quantization of Transformer Neural Machine Language Translation Model},
author = {Aishwarya Bhandare and Vamsi Sripathi and Deepthi Karkada and Vivek Menon and Sun Choi and Kushal Datta and Vikram Saletore},
journal= {arXiv preprint arXiv:1906.00532},
year = {2019}
}
备注
To appear at the Joint Workshop on On-Device Machine Learning & Compact Deep Neural Network Representations, 36th International Conference on Machine Learning, Long Beach, California, 2019