中文

通过多语言迁移学习利用域外平行数据提升低资源神经机器翻译

计算与语言 2019-07-09 v1

摘要

本文针对极具挑战性的日俄翻译对,提出了一种用于低资源神经机器翻译(NMT)的新型多语言多阶段微调方法。尽管针对低资源场景已有诸多解决方案,如多语言 NMT 与反向翻译,但我们在经验上证实,当仅限于领域内数据时,这些方法成效有限。因此我们提出通过迁移学习来利用域外数据:先使用域外数据训练一个多语言 NMT 模型,随后在领域内平行数据与反向翻译得到的伪平行数据上进行多阶段微调。我们的方法结合了领域自适应、多语言性与反向翻译,在这一极低资源场景下,相较强基线将翻译质量提升了超过 3.7 个 BLEU 点。

关键词

引用

@article{arxiv.1907.03060,
  title  = {Exploiting Out-of-Domain Parallel Data through Multilingual Transfer Learning for Low-Resource Neural Machine Translation},
  author = {Aizhan Imankulova and Raj Dabre and Atsushi Fujita and Kenji Imamura},
  journal= {arXiv preprint arXiv:1907.03060},
  year   = {2019}
}

备注

Accepted at the 17th Machine Translation Summit