神经机器翻译合成数据中的领域、翻译体与时噪
计算与语言
2020-10-06 v2 机器学习
机器学习
摘要
神经机器翻译的质量可通过利用额外的单语资源来创建合成训练数据而得以提升。源端单语数据可被(正向)翻译为目标语言以进行自训练;目标端单语数据可被回译。广泛报道回译带来更优结果,但这能否归因于测试集中的人为产物?我们使用法英新闻翻译任务进行案例研究,并根据原语言对测试集进行划分。我们表明正向翻译在原本为源语言的句子上就 BLEU 而言带来更优增益,补充了先前研究显示回译在原本为目标语言的句子上有大幅改进。为更好理解正向与回译何时及为何有效,我们研究了领域、翻译体与时噪的作用。尽管翻译体效应已知会影响 MT 评估,我们还发现来自不同语言的新闻数据呈现细微领域差异,这亦是测试集不同部分表现各异的另一解释。我们进行了额外的低资源实验,表明正向翻译比回译对初始翻译系统质量更敏感,且在低资源环境下往往表现更差。
引用
@article{arxiv.1911.03362,
title = {Domain, Translationese and Noise in Synthetic Data for Neural Machine Translation},
author = {Nikolay Bogoychev and Rico Sennrich},
journal= {arXiv preprint arXiv:1911.03362},
year = {2020}
}