用于口语方言神经机器翻译的合成数据
计算与语言
2017-11-30 v2
摘要
在本文中,我们介绍了一种生成合成数据用于训练神经机器翻译系统的新方法。所提出的方法将给定书面语言与目标语言之间的平行语料转换为口语方言变体与目标语言之间的平行语料。我们的方法是语言无关的,可用于生成源语言的任何变体(例如俚语或口语方言)甚至与源语言密切相关的不同语言的数据。所提出的方法基于分布式表示的局部嵌入投影,利用单语嵌入来跨语言变体转换平行数据。我们报告了使用神经机器翻译进行黎凡特语到英语翻译的实验结果。我们表明,利用合成口语数据生成的数据可以将非常大规模的系统提高超过 2.8 个 Bleu 点,这表明它可用于为没有足够平行数据的口语方言提供可靠的翻译系统。
引用
@article{arxiv.1707.00079,
title = {Synthetic Data for Neural Machine Translation of Spoken-Dialects},
author = {Hany Hassan and Mostafa Elaraby and Ahmed Tawfik},
journal= {arXiv preprint arXiv:1707.00079},
year = {2017}
}