解决极低资源语言多语神经机器翻译中的词序分歧
计算与语言
2019-04-11 v2
摘要
神经机器翻译(NMT)的迁移学习方法先在辅助-目标语言对上训练 NMT 模型(父模型),随后针对感兴趣的源-目标语言对(子模型)进行微调,且目标语言相同。在许多情况下,辅助语言与源语言具有不同的词序。我们表明,当源语言与目标语言之间几乎没有或没有平行语料库时,分歧的词序会不利地限制迁移学习带来的益处。为弥合这一分歧,我们提议将辅助语言句子预排序以匹配源语言的词序,并训练父模型。我们在多种语言对上的实验表明,弥合词序差距可显著提升翻译质量。
引用
@article{arxiv.1811.00383,
title = {Addressing word-order Divergence in Multilingual Neural Machine Translation for extremely Low Resource Languages},
author = {Rudra Murthy and Anoop Kunchukuttan and Pushpak Bhattacharyya},
journal= {arXiv preprint arXiv:1811.00383},
year = {2019}
}
备注
Accepted as Short Paper at NAACL 2019