中文

基于词典与基于机器学习情感分析的比较:是否存在离群词?

计算与语言 2023-11-13 v1

摘要

基于词典的文本情感分析方法依赖于每个词或词条具有指示其情感极性的预定义权重。这些权重通常是人工指定的,但其准确性相对于基于机器学习计算情感的方法尚属未知。可能存在某些词条,其情感取值导致基于词典的方法给出的结果与机器学习方法大相径庭。在本文中,我们使用 Hedonometer(一种基于词典的技术)和 Azure(一种当代基于机器学习的方法,属于易于使用的 Azure 认知服务 API 系列)对取自 4 个领域的超过 150,000 篇英文文本计算情感。我们通过回归对每个领域中两种方法文档情感得分的差异进行建模,并将自变量(Hedonometer 词条)作为每个词对得分差异重要性与贡献的指标加以分析。我们的发现是:词的重要性取决于领域,且不存在系统性导致情感得分差异的突出词条。

关键词

引用

@article{arxiv.2311.06221,
  title  = {A Comparison of Lexicon-Based and ML-Based Sentiment Analysis: Are There Outlier Words?},
  author = {Siddhant Jaydeep Mahajani and Shashank Srivastava and Alan F. Smeaton},
  journal= {arXiv preprint arXiv:2311.06221},
  year   = {2023}
}

备注

4 pages, to appear in Proceedings of the 31st Irish Conference on Artificial Intelligence and Cognitive Science. December 7th-8th, 2023