中文

带标记的回译

计算与语言 2019-06-18 v1 机器学习

摘要

神经机器翻译(NMT)的近期工作表明,在回译(一种生成合成平行数据的方法)过程中采用加噪束解码可显著提升质量。我们指出,此类合成噪声的主要作用并非如先前所认为的那样使源端多样化,而仅仅是向模型表明给定源端为合成数据。我们提出了一种比加噪技术更简单的替代方案,即对回译的源句子附加一个额外标记进行标记。我们在 WMT 上的结果在英语-罗马尼亚语上优于加噪回译,在英语-德语上与之持平,并在前者上重新定义了 state-of-the-art。

关键词

引用

@article{arxiv.1906.06442,
  title  = {Tagged Back-Translation},
  author = {Isaac Caswell and Ciprian Chelba and David Grangier},
  journal= {arXiv preprint arXiv:1906.06442},
  year   = {2019}
}

备注

Accepted as oral presentation in WMT 2019; 9 pages; 9 tables; 1 figure