从最差中学习:动态生成数据集以改进在线仇恨检测
计算与语言
2021-06-04 v2 机器学习
摘要
我们提出一种人与模型协同回路(human-and-model-in-the-loop)流程,用于动态生成数据集并训练性能更好、更鲁棒的仇恨检测模型。我们提供一个约40,000条目的新数据集,由受过训练的标注者在四轮动态数据创建中生成并标注。它包含约15,000条具有挑战性的扰动,且每条仇恨条目都带有关于仇恨类型与目标的细粒度标签。仇恨条目占数据集的54%,远高于可比数据集。我们表明使用该方法的模型性能得到显著提升。在后续数据收集轮次上训练的模型在测试集上表现更好,且更难以被标注者欺骗。它们在HateCheck(一套在线仇恨检测的功能测试)上也表现更好。我们提供代码、数据集与标注指南供其他研究者使用。已被ACL 2021接收。
引用
@article{arxiv.2012.15761,
title = {Learning from the Worst: Dynamically Generated Datasets to Improve Online Hate Detection},
author = {Bertie Vidgen and Tristan Thrush and Zeerak Waseem and Douwe Kiela},
journal= {arXiv preprint arXiv:2012.15761},
year = {2021}
}