中文

改进低资源语言的零样本多语言神经机器翻译

计算与语言 2021-10-05 v1 人工智能

摘要

尽管扩展 Google 多语言 NMT 的多语言神经机器翻译(NMT)具备零样本翻译能力,且迭代自学习算法可提升零样本翻译质量,但其面临两个问题:多语言 NMT 模型在实施零样本翻译时易生成错误的目标语言;使用束搜索生成合成平行数据的自学习算法破坏了生成源语言的多样性,并在迭代学习过程中放大了相同噪声的影响。本文中,我们提出带标记的多语言 NMT 模型并改进自学习算法以应对这两个问题。首先,我们扩展 Google 的多语言 NMT 模型,向目标语言添加目标标记,将起始标签与目标语言关联,以确保源语言可翻译至所需目标语言。其次,我们通过以随机采样替换束搜索来改进自学习算法,从而增加生成数据的多样性并使其恰当覆盖真实数据分布。IWSLT 上的实验结果表明,调整后的带标记多语言 NMT 在 2010 和 2017 罗马尼亚语-意大利语测试集上分别比多语言 NMT 高出 9.41 和 7.85 的 BLEU 分数。类似地,其在意大利语-罗马尼亚语零样本翻译上获得 9.08 和 7.99 的 BLEU 分数。此外,改进的自学习算法在零样本翻译上展现出优于传统自学习算法的性能。

关键词

引用

@article{arxiv.2110.00712,
  title  = {Improving Zero-shot Multilingual Neural Machine Translation for Low-Resource Languages},
  author = {Chenyang Li and Gongxu Luo},
  journal= {arXiv preprint arXiv:2110.00712},
  year   = {2021}
}