中文

构建仇恨言论检测数据集的挑战

计算与语言 2023-09-07 v1 人工智能

摘要

仇恨言论检测已被表述为 NLP 的一项独立应用,并采用了不同方法来识别目标群体、获取原始数据、定义标注过程、选择检测算法以及在所需设定下评估性能。然而,不同于其他下游任务,由于该任务高度主观的性质,仇恨言论缺乏大规模、精心整理、可泛化的数据集。本文中,我们首先通过以数据为中心的视角分析围绕仇恨言论检测的问题。随后,我们以针对性少数群体仇恨言论的具体为例,勾勒出一个涵盖七个广泛维度的整体框架,以封装数据创建流程。我们主张,从业者在未来创建仇恨言论数据集时,将受益于遵循此框架作为一种最佳实践。

关键词

引用

@article{arxiv.2309.02912,
  title  = {On the Challenges of Building Datasets for Hate Speech Detection},
  author = {Vitthal Bhandari},
  journal= {arXiv preprint arXiv:2309.02912},
  year   = {2023}
}

备注

12 pages, 1 figure