中文

LMU Munich 的 WMT 2020 无监督机器翻译共享任务系统

计算与语言 2020-10-27 v1

摘要

本文描述了 LMU Munich 提交至 WMT 2020 无监督共享任务的系统,涉及两个语言方向:德语<->上索布语。我们的核心无监督神经机器翻译(UNMT)系统遵循 Chronopoulou 等人(2020)的策略,使用单语预训练语言生成模型(基于德语)并在德语和上索布语上微调,之后初始化一个用在线回译训练的 UNMT 模型。从无监督统计机器翻译(USMT)系统获得的伪平行数据用于微调 UNMT 模型。我们还对低资源(上索布语)数据应用 BPE-Dropout 以获得更鲁棒的系统。我们额外尝试了残差适配器,并发现它们在上索布语->德语方向上有效。我们探索了回译中的采样与课程学习,以更原则性地使用 SMT 翻译。最后,我们集成性能最佳的系统中,在德语->上索布语上达到 32.4 的 BLEU 分数,在上索布语->德语上达到 35.2。

关键词

引用

@article{arxiv.2010.13192,
  title  = {The LMU Munich System for the WMT 2020 Unsupervised Machine Translation Shared Task},
  author = {Alexandra Chronopoulou and Dario Stojanovski and Viktor Hangya and Alexander Fraser},
  journal= {arXiv preprint arXiv:2010.13192},
  year   = {2020}
}

备注

WMT Unsupervised Shared Task 2020