中文

面向语言变体的神经机器翻译

计算与语言 2018-11-06 v1

摘要

迄今为止,研究和商业机器翻译都忽视了妥善处理语言变体之间出现的拼写、词汇和语法差异的重要性。显著的例子是巴西葡萄牙语与欧洲葡萄牙语、加拿大法语与欧洲法语等标准国家变体,流行的在线机器翻译服务并未将它们区分开来。我们表明,将此类变体建模为单一类别的一个明显副作用是产生不一致的翻译。在这项工作中,我们研究了从英语到特定语言变体对的神经机器翻译训练问题,假设有标记和无标记的平行文本,并且处于低资源条件。我们报告了从英语到两对方言(欧洲-巴西葡萄牙语和欧洲-加拿大法语)以及两对标准化变体(克罗地亚语-塞尔维亚语和印尼语-马来语)的实验。我们展示了当将相似语言的翻译作为具有共享表示的多语言任务来学习时,相比基线系统取得了显著的 BLEU 分数提升。

关键词

引用

@article{arxiv.1811.01064,
  title  = {Neural Machine Translation into Language Varieties},
  author = {Surafel M. Lakew and Aliia Erofeeva and Marcello Federico},
  journal= {arXiv preprint arXiv:1811.01064},
  year   = {2018}
}

备注

Published at EMNLP 2018: third conference on machine translation (WMT 2018)