中文

基于朴素贝叶斯分类分析西爪哇省长选举公众情绪的文本挖掘应用架构

计算机与社会 2018-10-19 v1 计算与语言 信息检索 社会与信息网络

摘要

西爪哇省长选举是吸引公众关注的一件大事,社交媒体用户也不例外。公众对潜在地区领导人的意见有助于预测当选能力与选民倾向。可用于意见挖掘过程的数据可从Twitter获取。由于数据形式极为多样且高度非结构化,必须借助数据预处理技术将其管理并转化为半结构化数据。该半结构化信息随后进入分类阶段,将意见归类为负面或正面意见。研究方法采用文献研究,考察以往关于相似主题的研究。本研究旨在找到合适的架构,将其发展为Twitter意见挖掘应用,以了解公众对西爪哇省长选举的情绪。本研究的结果是:Twitter意见挖掘是文本挖掘的一部分,其中Twitter上的意见若欲分类,必须先经过文本预处理阶段。Twitter数据所需的预处理步骤为清洗、大小写归一化、词性标注与词干提取。所得文本挖掘架构是一种可用于不同主题文本挖掘研究的架构。

关键词

引用

@article{arxiv.1810.07767,
  title  = {Architecture of Text Mining Application in Analyzing Public Sentiments of West Java Governor Election using Naive Bayes Classification},
  author = {Suryanto Nugroho and Prihandoko},
  journal= {arXiv preprint arXiv:1810.07767},
  year   = {2018}
}

备注

5 Pages