波斯语情感分析器:一种基于新颖特征选择方法的框架
计算与语言
2014-12-30 v1 信息检索
摘要
近十年来,随着互联网和数据库中数字内容的巨大增长,情感分析在信息检索和自然语言处理研究人员中受到了越来越多的关注。情感分析旨在利用自动化工具从评论中检测主观信息。情感分析的主要挑战之一是特征选择。特征选择广泛用作分析和分类任务的第一阶段,以通过消除无关和冗余特征来降低问题维度并提高速度。迄今为止,由于针对情感分析中特征选择的研究很少,因此针对波斯语情感分析的工作极为罕见。本文研究了使用不同特征选择方法对波斯语在线客户评论进行情感分类的问题。波斯语文本的三个挑战包括使用多种变格后缀、不同的词间距以及许多非正式或口语词汇。在本文中,我们通过提出一种波斯语评论文档情感分类模型来研究这些挑战。所提出的模型基于词形还原和特征选择,并采用朴素贝叶斯(Naive Bayes)算法进行分类。我们在手动收集的手机评论集合上评估了该模型的性能,结果表明所提出的方法是有效的。
引用
@article{arxiv.1412.8079,
title = {Persian Sentiment Analyzer: A Framework based on a Novel Feature Selection Method},
author = {Ayoub Bagheri and Mohamad Saraee},
journal= {arXiv preprint arXiv:1412.8079},
year = {2014}
}