中文

解决极低资源语言多语神经机器翻译中的词序分歧

计算与语言 2019-04-11 v2

摘要

神经机器翻译(NMT)的迁移学习方法先在辅助-目标语言对上训练 NMT 模型(父模型),随后针对感兴趣的源-目标语言对(子模型)进行微调,且目标语言相同。在许多情况下,辅助语言与源语言具有不同的词序。我们表明,当源语言与目标语言之间几乎没有或没有平行语料库时,分歧的词序会不利地限制迁移学习带来的益处。为弥合这一分歧,我们提议将辅助语言句子预排序以匹配源语言的词序,并训练父模型。我们在多种语言对上的实验表明,弥合词序差距可显著提升翻译质量。

关键词

引用

@article{arxiv.1811.00383,
  title  = {Addressing word-order Divergence in Multilingual Neural Machine Translation for extremely Low Resource Languages},
  author = {Rudra Murthy and Anoop Kunchukuttan and Pushpak Bhattacharyya},
  journal= {arXiv preprint arXiv:1811.00383},
  year   = {2019}
}

备注

Accepted as Short Paper at NAACL 2019