基于字符的词嵌入在形态标注与机器翻译中对抗词打乱或随机噪声的鲁棒性如何
计算与语言
2017-04-17 v1
摘要
本文研究自然语言处理(NLP)对扰动词形的鲁棒性。尽管神经网络方法在某些任务和条件下能达到(近乎)类人准确率,它们往往对输入中的微小变化敏感,例如非规范输入(如拼写错误)。然而,在涉及用户生成内容的应用中,稳定性和鲁棒性都是期望的属性,而且人类能轻松应对此类噪声或对抗条件,因此这些属性更为重要。本文中,我们研究噪声输入的影响。我们考虑不同的噪声分布(一种噪声类型、噪声类型的组合)以及训练与测试时失配的噪声分布。此外,我们从经验上评估不同模型(卷积神经网络、循环神经网络、非神经模型)、不同基本单元(字符、字节对编码单元)和不同 NLP 任务(形态标注、机器翻译)的鲁棒性。
引用
@article{arxiv.1704.04441,
title = {How Robust Are Character-Based Word Embeddings in Tagging and MT Against Wrod Scramlbing or Randdm Nouse?},
author = {Georg Heigold and Günter Neumann and Josef van Genabith},
journal= {arXiv preprint arXiv:1704.04441},
year = {2017}
}
备注
9 pages