中文

在合成噪声上训练可提升机器翻译对自然噪声的鲁棒性

计算与语言 2019-02-06 v1 机器学习 机器学习

摘要

我们考虑使机器翻译对源端字符级变化(如拼写错误)更具鲁棒性的问题。现有方法通过应用字节对编码(BPE)和字符级编码器等子词模型来实现更大覆盖,但这些方法对拼写错误高度敏感。我们展示了在训练时使用少量随机合成噪声如何能显著改善对这些变化的鲁棒性,且不降低在干净文本上的性能。我们关注自然噪声上的翻译性能,如 Wikipedia 编辑日志中频繁修正所捕获的,并表明在训练时使用均衡的简单合成噪声组合,无需访问自然噪声数据或分布,即可实现对这类噪声的鲁棒性。

关键词

引用

@article{arxiv.1902.01509,
  title  = {Training on Synthetic Noise Improves Robustness to Natural Noise in Machine Translation},
  author = {Vladimir Karpukhin and Omer Levy and Jacob Eisenstein and Marjan Ghazvininejad},
  journal= {arXiv preprint arXiv:1902.01509},
  year   = {2019}
}