中文

数据多样化:一种用于神经机器翻译的简单策略

计算与语言 2020-10-06 v4 机器学习

摘要

我们提出数据多样化(Data Diversification):一种简单而有效的提升神经机器翻译(NMT)性能的策略。它利用多个前向与后向模型的预测结果对训练数据进行多样化处理,随后将其与原始数据集合并用于训练最终的 NMT 模型。我们的方法适用于所有 NMT 模型。它不像回译那样需要额外的单语数据,也不像模型集成那样增加更多计算量与参数。我们的方法在 WMT'14 英德与英法翻译任务中分别取得了 30.7 和 43.7 的 SOTA BLEU 分数。它还在另外 8 个翻译任务上大幅提升性能:4 个 IWSLT 任务(英德与英法)以及 4 个低资源翻译任务(英尼泊尔语与英僧伽罗语)。我们证明我们的方法优于知识蒸馏与对偶学习,其与模型集成表现出强相关性,并以困惑度换取更好的 BLEU 分数。我们已在 https://github.com/nxphi47/data_diversification 发布了源代码。

关键词

引用

@article{arxiv.1911.01986,
  title  = {Data Diversification: A Simple Strategy For Neural Machine Translation},
  author = {Xuan-Phi Nguyen and Shafiq Joty and Wu Kui and Ai Ti Aw},
  journal= {arXiv preprint arXiv:1911.01986},
  year   = {2020}
}

备注

Accepted as a conference paper at NeurIPS 2020