中文

神经机器翻译中的数据缩放定律:噪声与架构的影响

机器学习 2022-02-07 v1 计算与语言

摘要

在本工作中,我们研究了架构变化和训练数据质量对神经机器翻译(NMT)数据缩放特性的影响。首先,我们确立了编码器-解码器 transformer 模型的测试损失随训练样本数量呈幂律缩放,且依赖于模型大小。随后,我们系统地改变训练设置的各个方面,以理解它们如何影响数据缩放定律。具体而言,我们改变了以下方面:(1)架构与任务设置:我们与 transformer-LSTM 混合模型以及带有语言建模损失的仅解码器 transformer 进行比较;(2)训练分布中的噪声水平:我们尝试了过滤以及添加 iid 合成噪声。在上述所有情况下,我们发现数据缩放指数受到的影响极小,这表明略微较差的架构或训练数据可通过增加更多数据来弥补。最后,我们发现使用回译数据替代平行数据会显著恶化缩放指数。

关键词

引用

@article{arxiv.2202.01994,
  title  = {Data Scaling Laws in NMT: The Effect of Noise and Architecture},
  author = {Yamini Bansal and Behrooz Ghorbani and Ankush Garg and Biao Zhang and Maxim Krikun and Colin Cherry and Behnam Neyshabur and Orhan Firat},
  journal= {arXiv preprint arXiv:2202.01994},
  year   = {2022}
}