阿拉伯语文本情感分析:以更广泛的主题分析强化人工调查
计算与语言
2024-03-05 v1
摘要
情感分析(SA)一直且仍然是一个蓬勃发展的研究领域。然而,阿拉伯语情感分析(ASA)任务在研究体系中仍然代表性不足。本研究对现有基于文本内容的 ASA 研究进行了首次深入且广泛的分析,并确定了其共同的主题、应用领域、所使用的方法、途径、技术和算法。深入分析研究手动分析了 2002 年至 2020 年间发表在四个学术数据库(SAGE、IEEE、Springer、WILEY)和 Google Scholar 上的 133 篇英文 ASA 论文。广泛分析研究在开放获取资源上使用了现代自动化机器学习技术(如主题建模和时间序列分析),对 2010 年至 2020 年间的 2297 篇 ASA 出版物进行了分析,以强化先前研究确定的主题和趋势。主要发现展示了用于 ASA 的不同方法:机器学习、基于词典的方法和混合方法。其他发现包括 ASA 的“获胜”算法(SVM、NB、混合方法)。深度学习方法(如 LSTM)可以提供更高的准确性,但对于 ASA,有时语料库不够大,无法支持它们。此外,虽然存在一些 ASA 语料库和词典,但仍需要更多。具体而言,阿拉伯语推文语料库和数据集目前仅为中等规模。而且,具有高覆盖率的阿拉伯语词典仅包含现代标准阿拉伯语(MSA)单词,而包含阿拉伯语方言的词典则非常小。因此,需要创建新的语料库。另一方面,ASA 工具严重缺乏。需要开发可在工业界和学术界用于阿拉伯语文本 SA 的 ASA 工具。因此,我们的研究提供了对 ASA 研究相关挑战的见解,并提供了推动该领域发展的建议,例如缺乏方言阿拉伯语资源、阿拉伯语推文、用于 SA 的语料库和数据集。
引用
@article{arxiv.2403.01921,
title = {Arabic Text Sentiment Analysis: Reinforcing Human-Performed Surveys with Wider Topic Analysis},
author = {Latifah Almurqren and Ryan Hodgson and Alexandra Cristea},
journal= {arXiv preprint arXiv:2403.01921},
year = {2024}
}