中文

OPSD:波斯语攻击性社交媒体数据集及其基线评估

计算与语言 2024-04-09 v1 人工智能 机器学习

摘要

由于用户活动,社交媒体上仇恨言论和攻击性评论的激增日益普遍。此类评论会对个人的心理健康和社会行为产生不利影响。尽管该领域存在大量英语数据集,但波斯语的等效资源却很少。为了填补这一空白,本文引入了两个攻击性数据集。第一个数据集包含领域专家提供的标注,而第二个数据集包含通过网页爬取获得的大量无标签数据,用于无监督学习目的。为确保前一个数据集的质量,我们进行了细致的三阶段标注过程,并计算了 kappa 测度以评估标注者间的一致性。此外,我们在数据集上使用最先进的语言模型(无论是否采用掩码语言建模技术)以及机器学习算法进行了实验,以使用当代前沿方法为该数据集建立基线。XLM-RoBERTa 在该数据集的三分类和二分类版本上获得的 F1 分数分别为 76.9% 和 89.9%。

关键词

引用

@article{arxiv.2404.05540,
  title  = {OPSD: an Offensive Persian Social media Dataset and its baseline evaluations},
  author = {Mehran Safayani and Amir Sartipi and Amir Hossein Ahmadi and Parniyan Jalali and Amir Hossein Mansouri and Mohammad Bisheh-Niasar and Zahra Pourbahman},
  journal= {arXiv preprint arXiv:2404.05540},
  year   = {2024}
}

备注

16 pages, 5 figures, 8 tables