中文

用于参数精简神经机器翻译的训练中矩阵分解

计算与语言 2020-03-25 v2 机器学习

摘要

在本文中,我们提出使用训练中矩阵分解来减小神经机器翻译的模型规模。利用训练中矩阵分解,参数矩阵可分解为较小矩阵的乘积,从而通过大幅减少可学习参数数量来压缩大型机器翻译架构。我们将训练中矩阵分解应用于标准神经架构的不同层,并表明训练中分解能够减少近 50% 的可学习参数而不伴随任何 BLEU 分数的损失。此外,我们发现训练中矩阵分解在嵌入层上尤其有效,提供了一种简单且高效的方法来削减参数数量,对模型性能影响极小,且有时能提升性能。

关键词

引用

@article{arxiv.1910.06393,
  title  = {In-training Matrix Factorization for Parameter-frugal Neural Machine Translation},
  author = {Zachary Kaden and Teven Le Scao and Raphael Olivier},
  journal= {arXiv preprint arXiv:1910.06393},
  year   = {2020}
}