合成与自然噪声均会破坏神经机器翻译
计算与语言
2018-02-27 v2 机器学习
摘要
基于字符的神经机器翻译(NMT)模型缓解了未登录词问题,学习了形态学,并使我们更接近完全端到端的翻译系统。遗憾的是,它们也非常脆弱,在面对含噪声数据时很容易出错。在本文中,我们让 NMT 模型面对合成与自然来源的噪声。我们发现,最先进的模型甚至无法翻译中等噪声程度的文本,而人类理解这些文本毫无困难。我们探索了两种提高模型鲁棒性的方法:结构不变词表示与在噪声文本上的鲁棒训练。我们发现,基于字符卷积神经网络的模型能够同时学习对多种噪声具有鲁棒性的表示。
引用
@article{arxiv.1711.02173,
title = {Synthetic and Natural Noise Both Break Neural Machine Translation},
author = {Yonatan Belinkov and Yonatan Bisk},
journal= {arXiv preprint arXiv:1711.02173},
year = {2018}
}
备注
ICLR 2018 camera-ready