中文

AraCOVID19-MFH:阿拉伯语COVID-19多标签假新闻与仇恨言论检测数据集

计算与语言 2021-05-10 v1 人工智能

摘要

伴随COVID-19大流行,虚假与误导性信息的“信息疫情”已然出现,并复杂化了COVID-19的应对工作。Facebook与Twitter等社交网络站点在很大程度上助长了谣言、阴谋论、仇恨、仇外、种族主义与偏见的传播。为遏制假新闻传播,全球研究人员已并仍在持续付出可观努力以构建和共享COVID-19相关研究文章、模型与数据集。本文发布“AraCOVID19-MFH”:一个人工标注的多标签阿拉伯语COVID-19假新闻与仇恨言论检测数据集。我们的数据集包含10,828条阿拉伯语推文,标注有10种不同标签。标签设计考量了与事实核查任务相关的若干方面,如推文的可核查性、正/负向性以及事实性。为确认我们标注数据集的实用价值,我们用其训练并评估若干分类模型,并报告所得结果。尽管该数据集主要面向假新闻检测设计,它亦可被用于仇恨言论检测、观点/新闻分类、方言识别及诸多其他任务。

关键词

引用

@article{arxiv.2105.03143,
  title  = {AraCOVID19-MFH: Arabic COVID-19 Multi-label Fake News and Hate Speech Detection Dataset},
  author = {Mohamed Seghir Hadj Ameur and Hassina Aliane},
  journal= {arXiv preprint arXiv:2105.03143},
  year   = {2021}
}