中文

用于无监督机器翻译的跨模型回译蒸馏

计算与语言 2021-05-25 v4 机器学习

摘要

近期的无监督机器翻译(UMT)系统通常采用三个主要原则:初始化、语言建模与迭代回译,尽管其应用方式可能不同。关键在于,用于语言建模的迭代回译与去噪自编码为训练 UMT 系统提供了数据多样性。然而,这些多样化过程带来的增益似乎已趋于饱和。我们向标准 UMT 框架引入一个名为跨模型回译蒸馏(CBD)的新组件,旨在引发现有原则所缺乏的另一种层次的数据多样化。CBD 适用于所有先前的 UMT 方法。在我们的实验中,CBD 在 WMT'14 英-法、WMT'16 英-德和英-罗双语无监督翻译任务上取得了 SOTA,BLEU 分别为 38.2、30.1 和 36.3。它在 IWSLT 英-法和英-德任务上也带来了 1.5-3.3 的 BLEU 提升。通过广泛的实验分析,我们表明 CBD 之所以有效,是因为它接纳数据多样性,而其他类似变体则不然。

关键词

引用

@article{arxiv.2006.02163,
  title  = {Cross-model Back-translated Distillation for Unsupervised Machine Translation},
  author = {Xuan-Phi Nguyen and Shafiq Joty and Thanh-Tung Nguyen and Wu Kui and Ai Ti Aw},
  journal= {arXiv preprint arXiv:2006.02163},
  year   = {2021}
}

备注

Accepted to a conference paper at ICML 2021