具有领域敏感伪源的鲁棒机器翻译:百度-OSU WMT19 MT 鲁棒性共享任务系统报告
计算与语言
2019-06-25 v2
摘要
本文描述了百度研究院与俄勒冈州立大学为 WMT 2019 机器翻译鲁棒性共享任务联合开发的机器翻译系统。社交媒体的翻译是一个极具挑战性的问题,因为其风格与常规平行语料库(如新闻)非常不同,并且包含各类噪声。更糟糕的是,社交媒体平行语料的数量极为有限。本文中,我们采用一种领域敏感的训练方法,该方法利用来自主流领域的大量平行数据以及少量来自社交媒体的平行数据。此外,我们生成了一个具有伪噪声源句子的平行数据集,这些句子是使用以类似领域敏感方式训练的模型从单语数据回译得到的。与基线方法相比,我们在 En-Fr 和 Fr-En 翻译中均取得了超过 10 个 BLEU 的提升。
引用
@article{arxiv.1906.08393,
title = {Robust Machine Translation with Domain Sensitive Pseudo-Sources: Baidu-OSU WMT19 MT Robustness Shared Task System Report},
author = {Renjie Zheng and Hairong Liu and Mingbo Ma and Baigong Zheng and Liang Huang},
journal= {arXiv preprint arXiv:1906.08393},
year = {2019}
}
备注
accepted by WMT 2019