中文

基于自训练增强低资源神经机器翻译的反向翻译

计算与语言 2021-02-16 v3 机器学习

摘要

利用单语目标数据的反向翻译(合成平行数据)来改进神经机器翻译(NMT)模型,是目前训练改进翻译系统的前沿方法。许多研究表明,在可用平行数据上训练并用于反向翻译的后向系统的质量会影响最终 NMT 模型的性能。在低资源条件下,可用平行数据通常不足以训练出能够生成训练标准翻译模型所需的定性合成数据的后向模型。本文提出一种自训练策略,利用后向模型的输出通过前向翻译技术来改进模型自身。该技术将低资源基线 IWSLT'14 英德和 IWSLT'15 英越反向翻译模型分别提升了 11.06 和 1.5 个 BLEU。由改进的后向英德模型生成的合成数据被用于训练前向模型,其性能优于使用标准反向翻译训练的另一前向模型 2.7 个 BLEU。

关键词

引用

@article{arxiv.2006.02876,
  title  = {Enhanced back-translation for low resource neural machine translation using self-training},
  author = {Idris Abdulmumin and Bashir Shehu Galadanci and Abubakar Isa},
  journal= {arXiv preprint arXiv:2006.02876},
  year   = {2021}
}

备注

17 pages, 3 figures, 5 tables; Accepted for publication in the International Conference on Information and Communication Technology and Applications (ICTA 2020)