中文

摩洛哥方言情感分析数据集:弥合阿拉伯字母与拉丁字母书写方言间的鸿沟

计算与语言 2024-09-16 v3

摘要

情感分析,即判定文本中所表达情感或观点的自动化过程,在自然语言处理领域已得到广泛探索。然而,一个尚未得到充分代表的方面是摩洛哥方言的情感分析,其拥有独特的语言景观并共存多种文字系统。以往的情感分析工作主要针对采用阿拉伯字母的方言。尽管这些努力提供了有价值的见解,但它们可能无法完全捕捉摩洛哥网络内容的复杂性,后者融合了阿拉伯字母与拉丁字母。因此,我们的研究强调将情感分析扩展至涵盖摩洛哥语言多样性的整个谱系的重要性。我们研究的核心在于创建最大的摩洛哥方言情感分析公开数据集,其不仅包含以阿拉伯字母书写的摩洛哥方言,也包含以拉丁字母书写的摩洛哥方言。通过汇集多样化的文本数据,我们构建了一个包含 20 000 条人工标注摩洛哥方言文本的数据集,并公开提供了摩洛哥方言的停用词列表。为深入情感分析,我们对多种机器学习模型进行了比较研究以评估其与本数据集的适配性。实验同时使用原始与预处理数据,以展示预处理步骤的重要性。我们的模型达到了 92% 的准确率,并为进一步证明其可靠性,我们在更小的公开摩洛哥方言数据集上测试了该模型,结果令人满意。

关键词

引用

@article{arxiv.2303.15987,
  title  = {Sentiment Analysis Dataset in Moroccan Dialect: Bridging the Gap Between Arabic and Latin Scripted dialect},
  author = {Mouad Jbel and Mourad Jabrane and Imad Hafidi and Abdulmutallib Metrane},
  journal= {arXiv preprint arXiv:2303.15987},
  year   = {2024}
}

备注

Lang Resources & Evaluation (2024)