阿拉伯推文仇恨言论标注语料库
计算与语言
2025-05-26 v2
摘要
由于阿拉伯语方言变体丰富,识别其中的仇恨言论内容具有挑战性。本研究引入了一个阿拉伯语仇恨言论数据集。我们收集了 10000 条阿拉伯推文,并对每条推文进行标注,判断其是否包含冒犯性内容。如果文本包含冒犯性内容,我们进一步将其分类为不同的仇恨言论目标,如宗教、性别、政治、种族、起源或其他。一条文本可以包含单一或多个目标。多个标注者参与数据标注任务。我们计算了标注者之间的一致性,该值在冒犯内容方分为 0.86,在多个仇恨言论目标方分为 0.71。最后,我们通过采用不同的基于变换器的模型评估了数据标注任务,其中 AraBERTv2 的性能最佳,微-F1 分数为 0.7865,准确率为 0.786。
引用
@article{arxiv.2505.11969,
title = {An Annotated Corpus of Arabic Tweets for Hate Speech Analysis},
author = {Wajdi Zaghouani and Md. Rafiul Biswas},
journal= {arXiv preprint arXiv:2505.11969},
year = {2025}
}