迭代反向翻译中的动态数据选择与加权
计算与语言
2020-10-09 v2
摘要
反向翻译已被证明是在神经机器翻译(NMT)中利用单语数据的有效方法,而迭代地进行反向翻译可进一步提升模型性能。选择哪些单语数据进行反向翻译至关重要,因为我们需要所得合成数据质量高且反映目标领域。为实现这两个目标,已有数据选择与加权策略被提出,其常见做法是选取接近目标领域但与平均通用领域文本相异的样本。本文中,我们对该常用方法提供见解,并将其推广为一种动态课程学习策略,应用于迭代反向翻译模型。此外,我们提出了基于句子当前质量及其相对前一次迭代的改进程度的加权策略。我们在领域自适应、低资源与高资源MT设置以及两种语言对上评估了我们的模型。实验结果表明,我们的方法相较有竞争力的基线取得了最高1.8个BLEU点的提升。
引用
@article{arxiv.2004.03672,
title = {Dynamic Data Selection and Weighting for Iterative Back-Translation},
author = {Zi-Yi Dou and Antonios Anastasopoulos and Graham Neubig},
journal= {arXiv preprint arXiv:2004.03672},
year = {2020}
}
备注
EMNLP 2020