中文

Hatemoji:用于基准测试与检测基于表情符号的仇恨言论的测试套件与对抗生成数据集

计算与语言 2022-05-09 v3 计算机与社会

摘要

检测在线仇恨是一项复杂任务,而低性能模型在内容审核等敏感应用中使用时会产生有害后果。基于表情符号的仇恨是自动检测面临的新兴挑战。我们提出 HatemojiCheck,一个包含 3,930 条短文本陈述的测试套件,可评估以表情符号表达的仇恨语言上的性能。利用该测试套件,我们揭示了现有仇恨检测模型的弱点。为解决这些弱点,我们使用人机协同(human-and-model-in-the-loop)方法创建了 HatemojiBuild 数据集。使用这 5,912 个对抗样本构建的模型在检测基于表情符号的仇恨方面表现大幅更好,同时在纯文本仇恨上保持强劲性能。HatemojiCheck 和 HatemojiBuild 均已公开可用。见我们的 Github 仓库(https://github.com/HannahKirk/Hatemoji)。HatemojiCheck、HatemojiBuild 及最终的 Hatemoji 模型也发布于 HuggingFace(https://huggingface.co/datasets/HannahRoseKirk/)。

关键词

引用

@article{arxiv.2108.05921,
  title  = {Hatemoji: A Test Suite and Adversarially-Generated Dataset for Benchmarking and Detecting Emoji-based Hate},
  author = {Hannah Rose Kirk and Bertram Vidgen and Paul Röttger and Tristan Thrush and Scott A. Hale},
  journal= {arXiv preprint arXiv:2108.05921},
  year   = {2022}
}