中文

针对豪萨语、约鲁巴语和伊博语的多语言攻击性语言与仇恨言论检测数据集

计算与语言 2024-06-07 v2

摘要

在线攻击性语言的泛滥促使需要开发有效的检测机制,尤其是在多语言环境下。本研究通过为尼日利亚三种主要语言——豪萨语、约鲁巴语和伊博语——开发并引入新颖的攻击性语言检测数据集来应对这一挑战。我们从Twitter收集数据,并借助母语者进行人工标注,为每种语言创建了数据集。我们使用预训练语言模型来评估其在我们的数据集中检测攻击性语言的有效性。表现最佳的模型达到了90%的准确率。为进一步支持攻击性语言检测研究,我们计划公开该数据集及我们的模型。

关键词

引用

@article{arxiv.2406.02169,
  title  = {A multilingual dataset for offensive language and hate speech detection for hausa, yoruba and igbo languages},
  author = {Saminu Mohammad Aliyu and Gregory Maksha Wajiga and Muhammad Murtala},
  journal= {arXiv preprint arXiv:2406.02169},
  year   = {2024}
}

备注

The experimental result was erroneously reported and we also omitted other authors