中文

面向波兰语Twitter数据的情感分析模型

计算与语言 2019-11-05 v1 信息检索 机器学习 社会与信息网络

摘要

对2015年5月10日波兰总统选举期间收集的推文进行文本挖掘分析。该项目包括实现从Twitter检索信息的引擎、构建文档语料库、语料库清洗以及创建词项-文档矩阵。语料库中的每条推文根据其情感得分被分配一个类别。该得分使用每篇文档中正面和/或负面表情符号以及波兰语词的数量计算。所得数据集用于训练和测试四个机器学习分类器,以选出提供最准确自动推文分类结果的分类器。朴素贝叶斯和最大熵算法分别取得了71.76%和77.32%的最佳准确率。所有实现任务均使用R编程语言完成。

关键词

引用

@article{arxiv.1911.00985,
  title  = {Sentiment analysis model for Twitter data in Polish language},
  author = {Karol Chlasta},
  journal= {arXiv preprint arXiv:1911.00985},
  year   = {2019}
}