中文

NaijaHate:使用代表性数据评估尼日利亚 Twitter 上的仇恨言论检测

计算与语言 2024-06-25 v3

摘要

为了解决全球性的网络仇恨问题,仇恨言论检测(HSD)系统通常基于来自美国的数据集开发,因此无法泛化到来自多数世界(Majority World)的英语方言。此外,HSD模型通常在非代表性样本上进行评估,引发了对在真实世界环境中高估模型性能的担忧。在这项工作中,我们引入了NaijaHate,这是第一个为HSD标注的包含尼日利亚推文代表性样本的数据集。我们证明,在文献中传统使用的有偏数据集上评估HSD,会持续将真实世界性能高估至少两倍。然后,我们提出了NaijaXLM-T,一个针对尼日利亚 Twitter 语境量身定制的预训练模型,并确立了领域自适应预训练和微调在最大化HSD性能中的关键作用。最后,由于HSD系统在真实世界条件下的性能有限,我们发现内容审核人员每天需要审核约一万条被标记为仇恨的尼日利亚推文,才能审核60%的仇恨内容,突显了随着全球社交媒体使用量的持续增长,大规模审核仇恨言论面临的挑战。总而言之,这些结果为开发稳健的HSD系统以及在低资源环境下更好地保护社交媒体用户免受仇恨内容侵害铺平了道路。

关键词

引用

@article{arxiv.2403.19260,
  title  = {NaijaHate: Evaluating Hate Speech Detection on Nigerian Twitter Using Representative Data},
  author = {Manuel Tonneau and Pedro Vitor Quinta de Castro and Karim Lasri and Ibrahim Farouq and Lakshminarayanan Subramanian and Victor Orozco-Olvera and Samuel P. Fraiberger},
  journal= {arXiv preprint arXiv:2403.19260},
  year   = {2024}
}

备注

ACL 2024 main conference. Data and models available at https://github.com/worldbank/NaijaHate