中文

AfriHate:非洲语言仇恨与滥用语言数据集的多语言集合

计算与语言 2025-01-16 v2

摘要

仇恨言语和滥用语言是全球性现象,需要社会文化背景知识才能被正确理解、识别和审查。然而,在全球南部许多地区,都有多个已记录的(1)缺乏审查和(2)因依赖无上下文的关键词匹配而进行审查的案例。此外,许多名人经常位于审查过程中,而针对少数族裔的大规模针对性仇恨运动则被忽视了。这些限制主要源于缺乏当地语言的高质量数据,以及未能包括当地社区在数据收集、标注和审查过程中。为此,我们提出AfriHate:一个包含15种非洲语言的仇恨言语和滥用语言数据集的多语言集合。AfriHate中的每个实例都由熟悉当地文化的母语者标注。我们报告了数据集构建过程中的挑战,并呈现了使用与不使用大语言模型(LLM)的各种分类基线结果。数据集、 individual 标注以及仇恨言语和冒犯性语言词汇表均已发布于 https://github.com/AfriHate/AfriHate。

关键词

引用

@article{arxiv.2501.08284,
  title  = {AfriHate: A Multilingual Collection of Hate Speech and Abusive Language Datasets for African Languages},
  author = {Shamsuddeen Hassan Muhammad and Idris Abdulmumin and Abinew Ali Ayele and David Ifeoluwa Adelani and Ibrahim Said Ahmad and Saminu Mohammad Aliyu and Nelson Odhiambo Onyango and Lilian D. A. Wanzare and Samuel Rutunda and Lukman Jibril Aliyu and Esubalew Alemneh and Oumaima Hourrane and Hagos Tesfahun Gebremichael and Elyas Abdi Ismail and Meriem Beloucif and Ebrahim Chekol Jibril and Andiswa Bukula and Rooweither Mabuya and Salomey Osei and Abigail Oppong and Tadesse Destaw Belay and Tadesse Kebede Guge and Tesfa Tegegne Asfaw and Chiamaka Ijeoma Chukwuneke and Paul Röttger and Seid Muhie Yimam and Nedjma Ousidhoum},
  journal= {arXiv preprint arXiv:2501.08284},
  year   = {2025}
}