中文

利用NLP云API简化文本数据增强

计算与语言 2018-12-13 v1 机器学习

摘要

在实践中,人们常发现自己拥有过少的文本数据来训练深度神经网络。这道“大数据墙”对互联网上的少数语言社群、组织、实验室以及与GAFAM(Google、Amazon、Facebook、Apple、Microsoft)竞争的公司构成了挑战。尽管大多数文本数据增强的研究努力着眼于寻找端到端学习方案的长期目标,这等同于“用神经网络喂神经网络”,本工程工作聚焦于使用实用、鲁棒、可扩展且易实现的数据增强预处理技术,类似于在计算机视觉中成功的技术。我们实验了若干文本增强技术。一些已有技术被测试以作比较,如噪声注入或正则表达式的使用。其他为改进或修改的技术,如词汇替换。最后更具创新性的,如利用回译或句法树变换生成释义,基于鲁棒、可扩展且易用的NLP云API。所有研究的文本增强技术,在仅5的放大因子下,在标准化文本极性预测任务上使结果准确率提升4.3%至21.6%,伴有显著统计波动。测试了若干标准深度神经网络架构:多层感知机(MLP)、长短期记忆循环网络(LSTM)和双向LSTM(biLSTM)。经典XGBoost算法经测试有高达2.5%的提升。

关键词

引用

@article{arxiv.1812.04718,
  title  = {Text Data Augmentation Made Simple By Leveraging NLP Cloud APIs},
  author = {Claude Coulombe},
  journal= {arXiv preprint arXiv:1812.04718},
  year   = {2018}
}

备注

33 pages, 25 figures