中文

面向数字文本分析的深度学习:情感分析

计算与语言 2018-04-12 v1

摘要

在当下的情境中,设想一个没有负面信息的世界是极不现实的,因为坏新闻比好新闻传播得更具病毒性。尽管在现实生活中似乎不切实际,但可通过利用机器学习与自然语言处理技术构建系统来识别带有负面色彩的新闻数据,并仅将具有正面色彩(好新闻)的新闻过滤给终端用户来实现。本工作中,约二十万条数据通过使用基于规则与数据驱动相结合的方法进行了训练与测试。VADER 连同一种过滤方法被用作标注工具,随后采用统计机器学习方法,使用文档词项矩阵(表示)与支持向量机(分类)。深度学习算法随后引入以使该系统更可靠(Doc2Vec),最终采用卷积神经网络(CNN),其效果优于其他实验模块。该系统训练准确率达 96%,而测试准确率(内部与外部新闻数据)高于 85%。

关键词

引用

@article{arxiv.1804.03673,
  title  = {Deep Learning for Digital Text Analytics: Sentiment Analysis},
  author = {Reshma U and Barathi Ganesh H B and Mandar Kale and Prachi Mankame and Gouri Kulkarni},
  journal= {arXiv preprint arXiv:1804.03673},
  year   = {2018}
}

备注

8 pages