中文

有毒语言检测:阿拉伯语数据集的系统综述

计算与语言 2024-01-31 v2

摘要

近年来,阿拉伯语中有毒语言的检测已成为一个活跃的研究领域,审查用于训练所开发解决方案的现有数据集已成为一项迫切需求。本文对专注于网络有毒语言的阿拉伯语数据集进行了全面调查。我们系统地收集了共 54 个可用数据集及其对应论文,并进行了详尽的分析,考虑了四个主要维度下的 18 项标准:可用性细节、内容、标注过程和可重用性。该分析使我们能够识别现有差距,并为未来的研究工作提出建议。为了研究社区的便利,所分析的数据集列表维护在一个 GitHub 仓库中 (https://github.com/Imene1/Arabic-toxic-language)。

关键词

引用

@article{arxiv.2312.07228,
  title  = {Toxic language detection: a systematic review of Arabic datasets},
  author = {Imene Bensalem and Paolo Rosso and Hanane Zitouni},
  journal= {arXiv preprint arXiv:2312.07228},
  year   = {2024}
}