中文

情感分析库的对比分析

计算与语言 2023-07-27 v1

摘要

本研究的主要目标是通过机器学习方法对各类库提供对比比较。自然语言处理(NLP)专家对文本变化的情感分析(SA)兴趣日益增长。采用 NLP 文本分析技术的目的是识别并分类与推特用户话语相关的情感。本考察同时探讨了 SA 的问题及所用库,并提供若干协作方法以分类情感极性。近期研究表明,朴素贝叶斯分类器、决策树分类器、最大熵分类器、Sklearn 分类器、Sklearn 分类器 MultinomialNB 及其他联合学习算法非常有效。项目中将使用五个 Python 与 R 库:NLTK、TextBlob、Vader、Transformers(GPT 与 BERT 预训练)以及 Tidytext,以应用情感分析技术。还将使用四种机器学习模型:决策树(DT)、支持向量机(SVM)、朴素贝叶斯(NB)和 K 近邻(KNN)。为评估 SA 库在社交网络环境中的运行表现,还进行了对比研究。本实验使用每种方法单一数据集,以精确率、召回率和 F1 分数为指标评估最佳算法。我们得出结论:推荐使用准确率为 0.973 的 BERT transformer 方法用于情感分析。

关键词

引用

@article{arxiv.2307.14311,
  title  = {Comparative Analysis of Libraries for the Sentimental Analysis},
  author = {Wendy Ccoya and Edson Pinto},
  journal= {arXiv preprint arXiv:2307.14311},
  year   = {2023}
}

备注

5 pages, 2 figures