中文

MultiProSE:用于宣传、情感与情绪检测的多标签阿拉伯语数据集

计算与语言 2025-02-21 v1

摘要

宣传是一种说服形式,历史上一直被用于通过修辞和心理说服技巧为特定目的影响人们的意见。尽管阿拉伯语在互联网上排名第四,但除英语以外的语言(尤其是阿拉伯语)的宣传检测资源仍然极其有限。为了填补这一空白,第一个用于多标签宣传、情感和情绪检测的阿拉伯语数据集 MultiProSE 被引入。MultiProSE 是现有阿拉伯语宣传数据集 ArPro 的开源扩展,增加了每个文本的情感和情绪标注。该数据集包含8000篇标注新闻文章,是目前最大的宣传数据集。对于每项任务,使用大语言模型(LLM)(如 GPT-4o-mini)和预训练语言模型(PLM)(包括三个基于BERT的模型)开发了若干基线。该数据集、标注指南和源代码均公开发布,以促进阿拉伯语语言模型未来的研究与发展,并有助于更深入地理解新闻媒体中各种意见维度如何相互作用。

关键词

引用

@article{arxiv.2502.08319,
  title  = {MultiProSE: A Multi-label Arabic Dataset for Propaganda, Sentiment, and Emotion Detection},
  author = {Lubna Al-Henaki and Hend Al-Khalifa and Abdulmalik Al-Salman and Hajar Alqubayshi and Hind Al-Twailay and Gheeda Alghamdi and Hawra Aljasim},
  journal= {arXiv preprint arXiv:2502.08319},
  year   = {2025}
}

备注

12 pages, 3 figuers, 4 tabels