中文

一种用于构建仇恨言论检测数据集的信息检索方法

计算与语言 2021-11-11 v3 信息检索

摘要

构建仇恨言论检测的基准数据集面临诸多挑战。首先,由于仇恨言论相对稀少,随机采样推文进行标注在发现仇恨言论上效率极低。为此,已有数据集通常仅包含匹配已知“仇恨词”的推文。然而,将数据限制于预定义词表可能会排除我们所试图建模的现实现象的部分内容。第二个挑战是仇恨言论的定义往往高度多变且主观。具有不同先前概念的标注者不仅可能彼此分歧,还难以遵从指定的标注指南。我们的核心见解是,仇恨言论的稀有性与主观性类似于信息检索(IR)中相关性的稀有性与主观性。这一联系表明,创建 IR 测试集的成熟方法可有益地应用于创建更好的仇恨言论基准数据集。为智能且高效地选择待标注推文,我们应用了标准 IR 技术中的{\em 池化}(pooling)与{\em 主动学习}(active learning)。为提升标注的一致性与价值,我们应用了{\em 任务分解}(task decomposition)与{\em 标注者理由}(annotator rationale)技术。我们分享了一个用于 Twitter 上仇恨言论检测的新基准数据集,其相比先前数据集提供了更广的仇恨覆盖。我们还展示了现有检测模型在这些更广形式仇恨上测试时准确率的急剧下降。我们收集的标注者理由不仅佐证标注决策,还为未来在建模中进行双重监督及/或解释生成的工作提供了机会。我们方法的更多细节见补充材料。

关键词

引用

@article{arxiv.2106.09775,
  title  = {An Information Retrieval Approach to Building Datasets for Hate Speech Detection},
  author = {Md Mustafizur Rahman and Dinesh Balakrishnan and Dhiraj Murthy and Mucahid Kutlu and Matthew Lease},
  journal= {arXiv preprint arXiv:2106.09775},
  year   = {2021}
}

备注

Accepted as a full paper at 35th Conference on Neural Information Processing Systems (NeurIPS 2021) Track on Datasets and Benchmarks. (https://openreview.net/group?id=NeurIPS.cc/2021/Track/Datasets_and_Benchmarks/Round2)