中文

低资源目标语言翻译中的大规模并行跨语言学习

计算与语言 2021-05-20 v2

摘要

我们致力于从富资源语言到低资源语言的翻译。我们确定的主要挑战包括缺乏低资源语言数据、缺乏有效的跨语言迁移方法,以及神经系统中常见的变量绑定问题。我们构建了一个翻译系统,以八个欧洲语系为试验场来应对这些挑战。首先,我们加入源语言和目标语系标签,并研究语系内和语系间影响以实现有效的跨语言迁移。与使用单一语系的多源多目标基线相比,我们利用八个语系在英瑞(English-Swedish)翻译中实现了+9.9的BLEU分数提升。此外,我们发现,在最接近低资源语言的两个邻近语系上训练通常已足够。其次,我们构建了消融研究,发现即便目标数据显著更少,也能取得相当好的结果。第三,我们通过构建保序命名实体翻译模型来解决变量绑定问题。在定性评估中我们获得了60.6%的准确率,在初步研究中我们的翻译类似于人类翻译。

关键词

引用

@article{arxiv.1804.07878,
  title  = {Massively Parallel Cross-Lingual Learning in Low-Resource Target Language Translation},
  author = {Zhong Zhou and Matthias Sperber and Alex Waibel},
  journal= {arXiv preprint arXiv:1804.07878},
  year   = {2021}
}

备注

Accepted at 2018 Third Conference on Machine Translation (WMT18)