中文

4位精度及更高精度的神经机器翻译

计算与语言 2019-09-23 v2 机器学习

摘要

神经机器翻译(NMT)对资源消耗较大。我们设计了一种量化流程,以更好地压缩NMT模型,适配硬件能力受限的设备。由于大多数神经网络参数接近于零,我们采用对数量化代替定点量化。然而,我们发现偏置项不太适合对数量化,但注意到它们仅占模型的极小部分,因此将其保留为未压缩状态。我们还提出在再训练期间使用误差反馈机制,将压缩模型保留为陈旧梯度。我们通过实验表明,基于Transformer或RNN架构的NMT模型可压缩至4位精度而不出现明显质量下降。模型可压缩至二值精度,尽管质量较低。与Transformer相比,RNN架构似乎对量化更具鲁棒性。

关键词

引用

@article{arxiv.1909.06091,
  title  = {Neural Machine Translation with 4-Bit Precision and Beyond},
  author = {Alham Fikri Aji and Kenneth Heafield},
  journal= {arXiv preprint arXiv:1909.06091},
  year   = {2019}
}