数据多样化:一种用于神经机器翻译的简单策略
计算与语言
2020-10-06 v4 机器学习
摘要
我们提出数据多样化(Data Diversification):一种简单而有效的提升神经机器翻译(NMT)性能的策略。它利用多个前向与后向模型的预测结果对训练数据进行多样化处理,随后将其与原始数据集合并用于训练最终的 NMT 模型。我们的方法适用于所有 NMT 模型。它不像回译那样需要额外的单语数据,也不像模型集成那样增加更多计算量与参数。我们的方法在 WMT'14 英德与英法翻译任务中分别取得了 30.7 和 43.7 的 SOTA BLEU 分数。它还在另外 8 个翻译任务上大幅提升性能:4 个 IWSLT 任务(英德与英法)以及 4 个低资源翻译任务(英尼泊尔语与英僧伽罗语)。我们证明我们的方法优于知识蒸馏与对偶学习,其与模型集成表现出强相关性,并以困惑度换取更好的 BLEU 分数。我们已在 https://github.com/nxphi47/data_diversification 发布了源代码。
引用
@article{arxiv.1911.01986,
title = {Data Diversification: A Simple Strategy For Neural Machine Translation},
author = {Xuan-Phi Nguyen and Shafiq Joty and Wu Kui and Ai Ti Aw},
journal= {arXiv preprint arXiv:1911.01986},
year = {2020}
}
备注
Accepted as a conference paper at NeurIPS 2020