用于参数精简神经机器翻译的训练中矩阵分解
计算与语言
2020-03-25 v2 机器学习
摘要
在本文中,我们提出使用训练中矩阵分解来减小神经机器翻译的模型规模。利用训练中矩阵分解,参数矩阵可分解为较小矩阵的乘积,从而通过大幅减少可学习参数数量来压缩大型机器翻译架构。我们将训练中矩阵分解应用于标准神经架构的不同层,并表明训练中分解能够减少近 50% 的可学习参数而不伴随任何 BLEU 分数的损失。此外,我们发现训练中矩阵分解在嵌入层上尤其有效,提供了一种简单且高效的方法来削减参数数量,对模型性能影响极小,且有时能提升性能。
引用
@article{arxiv.1910.06393,
title = {In-training Matrix Factorization for Parameter-frugal Neural Machine Translation},
author = {Zachary Kaden and Teven Le Scao and Raphael Olivier},
journal= {arXiv preprint arXiv:1910.06393},
year = {2020}
}