带标记的回译
计算与语言
2019-06-18 v1 机器学习
摘要
神经机器翻译(NMT)的近期工作表明,在回译(一种生成合成平行数据的方法)过程中采用加噪束解码可显著提升质量。我们指出,此类合成噪声的主要作用并非如先前所认为的那样使源端多样化,而仅仅是向模型表明给定源端为合成数据。我们提出了一种比加噪技术更简单的替代方案,即对回译的源句子附加一个额外标记进行标记。我们在 WMT 上的结果在英语-罗马尼亚语上优于加噪回译,在英语-德语上与之持平,并在前者上重新定义了 state-of-the-art。
引用
@article{arxiv.1906.06442,
title = {Tagged Back-Translation},
author = {Isaac Caswell and Ciprian Chelba and David Grangier},
journal= {arXiv preprint arXiv:1906.06442},
year = {2019}
}
备注
Accepted as oral presentation in WMT 2019; 9 pages; 9 tables; 1 figure