中文

利用辅助语言与数据选择的神经机器翻译预训练方法

计算与语言 2020-01-24 v1 机器学习

摘要

利用大型单语数据进行序列到序列(S2S)预训练已知可在低资源场景下改善各类 S2S 自然语言处理任务的性能。然而,目标语言(LOI)未必总能获得大型单语语料。为此,我们提出利用其他语言的单语语料来弥补 LOI 单语语料的匮乏。以低资源日英神经机器翻译(NMT)为案例研究表明,利用大型中文和法文单语语料可分别缓解日文和英文单语语料的不足,用于 S2S 预训练。我们进一步展示了如何利用文字映射(中文到日文)来提升两个单语语料之间的相似度,从而进一步改善翻译质量。此外,我们提出了在预训练之前使用的简单数据选择技术,这些技术对 S2S 预训练的质量有显著影响。对我们所提方法的实证比较表明,在低资源场景下的 NMT 预训练中,利用辅助语言单语语料、数据选择以及文字映射极为重要。

关键词

引用

@article{arxiv.2001.08353,
  title  = {Pre-training via Leveraging Assisting Languages and Data Selection for Neural Machine Translation},
  author = {Haiyue Song and Raj Dabre and Zhuoyuan Mao and Fei Cheng and Sadao Kurohashi and Eiichiro Sumita},
  journal= {arXiv preprint arXiv:2001.08353},
  year   = {2020}
}

备注

Work in progress. Submitted to a conference