中文

构建用于波斯语社交微博情感分析的口语化数据集

计算与语言 2024-03-08 v2

摘要

引言:微博网站已汇聚丰富的情感分析与观点挖掘数据源。在这方面,情感分类常显低效,因为微博帖子通常缺乏句法一致的术语与表述,这些社交网络上的用户不愿撰写冗长陈述。此外,低资源语言存在一些局限。波斯语具有独特特征,需要专门的标注数据与模型用于情感分析任务,这不同于英语方言中的文本特征。方法:本文首先在协作环境与内部来源方式下构建名为ITRC-Opinion的用户观点数据集。我们的数据集包含来自Twitter和Instagram等社交微博的60,000条非正式与口语化波斯语文本。其次,本研究提出一种基于卷积神经网络(CNN)模型的新架构,以对社交微博帖子中的口语化文本进行更有效的情感分析。所构建的数据集用于评估该架构。此外,一些模型如LSTM、CNN-RNN、BiLSTM和BiGRU,配合不同词嵌入(包括Fasttext、Glove和Word2vec),对我们的数据集进行了研究并评估结果。结果:结果证明了我们的数据集与所提模型(72%准确率)的益处,显示出情感分类性能的显著提升。

关键词

引用

@article{arxiv.2306.12679,
  title  = {Constructing Colloquial Dataset for Persian Sentiment Analysis of Social Microblogs},
  author = {Mojtaba Mazoochi and Leila Rabiei and Farzaneh Rahmani and Zeinab Rajabi},
  journal= {arXiv preprint arXiv:2306.12679},
  year   = {2024}
}