中文

神经机器翻译的缩放定律

机器学习 2021-09-17 v1 人工智能 计算与语言

摘要

我们针对神经机器翻译(NMT)中使用的编码器-解码器Transformer模型,提出了关于其缩放特性的实证研究。我们表明,交叉熵损失作为模型大小的函数遵循某种缩放定律。具体而言:(i)我们提出了一个公式,将交叉熵损失的缩放行为描述为编码器和解码器大小的二元函数,并表明其在多种缩放方法和语言下均能准确预测;我们表明仅用参数总量不足以用于此类目的。(ii)我们观察到在缩放解码器与缩放编码器时具有不同的幂律指数,并基于该观察给出了编码器/解码器容量最优分配的推荐。(iii)我们还报告模型的缩放行为受到训练/测试集组合偏差的剧烈影响,我们将其定义为偏离自然生成文本的任何情况(无论是机器生成还是人工翻译文本)。我们观察到目标端自然文本具有缩放特性,表现为交叉熵损失的成功降低。(iv)最后,我们研究了交叉熵损失与生成翻译质量之间的关系。我们发现两种不同的行为,取决于测试数据的性质。对于原本从目标语言翻译为源语言的测试集,损失和BLEU分数都随模型大小增加而改善。相反,对于原本从源语言翻译为目标语言的测试集,损失改善,但BLEU分数在某一阈值后停止改善。我们发布了本研究中所有模型生成的文本。

关键词

引用

@article{arxiv.2109.07740,
  title  = {Scaling Laws for Neural Machine Translation},
  author = {Behrooz Ghorbani and Orhan Firat and Markus Freitag and Ankur Bapna and Maxim Krikun and Xavier Garcia and Ciprian Chelba and Colin Cherry},
  journal= {arXiv preprint arXiv:2109.07740},
  year   = {2021}
}

备注

31 pages, 23 figures