4位精度及更高精度的神经机器翻译
计算与语言
2019-09-23 v2 机器学习
摘要
神经机器翻译(NMT)对资源消耗较大。我们设计了一种量化流程,以更好地压缩NMT模型,适配硬件能力受限的设备。由于大多数神经网络参数接近于零,我们采用对数量化代替定点量化。然而,我们发现偏置项不太适合对数量化,但注意到它们仅占模型的极小部分,因此将其保留为未压缩状态。我们还提出在再训练期间使用误差反馈机制,将压缩模型保留为陈旧梯度。我们通过实验表明,基于Transformer或RNN架构的NMT模型可压缩至4位精度而不出现明显质量下降。模型可压缩至二值精度,尽管质量较低。与Transformer相比,RNN架构似乎对量化更具鲁棒性。
引用
@article{arxiv.1909.06091,
title = {Neural Machine Translation with 4-Bit Precision and Beyond},
author = {Alham Fikri Aji and Kenneth Heafield},
journal= {arXiv preprint arXiv:1909.06091},
year = {2019}
}