非母语者文本的神经机器翻译
计算与语言
2019-03-13 v2
摘要
众所周知,神经机器翻译(NMT)系统在遇到噪声数据时会性能下降,尤其在系统仅在干净数据上训练时。本文中,我们表明用含人工引入语法错误的句子增广训练数据可使系统对这些错误更鲁棒。结合自动语法错误纠正系统,我们可挽回因语法错误而损失的 2.4 BLEU 中的 1.5 BLEU。我们还给出了 JFLEG 语法错误纠正语料的西班牙语翻译集,可用于测试 NMT 对真实语法错误的鲁棒性。
引用
@article{arxiv.1808.06267,
title = {Neural Machine Translation of Text from Non-Native Speakers},
author = {Antonios Anastasopoulos and Alison Lui and Toan Nguyen and David Chiang},
journal= {arXiv preprint arXiv:1808.06267},
year = {2019}
}
备注
accepted at NAACL-HLT 2019