中文

基于词典归纳的神经机器翻译领域自适应

计算与语言 2019-06-04 v1

摘要

先前已有研究指出,神经机器翻译(NMT)对领域偏移非常敏感。在本文中,我们认为这是NMT高度词汇化本质的双重影响:导致含有大量未知单词的句子失败,以及对领域特定单词缺乏监督。为补救该问题,我们提出一种无监督自适应方法,其使用伪领域内语料对预训练的域外NMT模型进行微调。具体而言,我们执行词典归纳以提取领域内词典,并通过对待翻译的单语领域内目标句子执行逐词回译来构建伪并行领域内语料。在五个领域、超过二十种成对自适应设置和两种模型架构下,我们的方法在不使用任何领域内并行句子的情况下取得了一致的改进,相较未自适应模型最高提升14 BLEU,相较强回译基线最高提升2 BLEU。

关键词

引用

@article{arxiv.1906.00376,
  title  = {Domain Adaptation of Neural Machine Translation by Lexicon Induction},
  author = {Junjie Hu and Mengzhou Xia and Graham Neubig and Jaime Carbonell},
  journal= {arXiv preprint arXiv:1906.00376},
  year   = {2019}
}