中文

关于低资源语言翻译中Transformer最优深度的研究

计算与语言 2020-04-16 v2 机器学习

摘要

Transformer作为低资源语言神经机器翻译(NMT)的一种方法已展现出巨大前景。然而与此同时,Transformer模型仍然难以优化,且需要仔细调整超参数才能在此场景下发挥作用。许多NMT工具包附带一组默认超参数,研究人员与从业者常出于便利和避免调参而采用。但这些配置是针对英语和法语等欧洲语言的数百万平行句大规模机器翻译数据集优化的。本工作中,我们发现当前领域中使用超大模型的趋势对低资源语言有害,因为这使训练更困难并损害整体性能,印证了此前的观察。我们将自己的工作视为对Masakhane项目(“Masakhane”在isiZulu语中意为“我们一起构建”)的补充。本着这一精神,低资源NMT系统正由最亟需它们的社区构建。然而,社区中许多人仍极难获取工业界研究所推崇的构建极大型模型所需的计算资源。因此,通过表明Transformer模型在低到中等深度时表现良好(且常最佳),我们希望说服同行研究者在开发这些系统时,减少在计算资源与时间上探索过大模型。

关键词

引用

@article{arxiv.2004.04418,
  title  = {On Optimal Transformer Depth for Low-Resource Language Translation},
  author = {Elan van Biljon and Arnu Pretorius and Julia Kreutzer},
  journal= {arXiv preprint arXiv:2004.04418},
  year   = {2020}
}