ToxiGen:用于对抗性与隐性仇恨言论检测的大规模机器生成数据集
计算与语言
2022-07-15 v4
摘要
毒性语言检测系统常将包含少数群体提及的文本误判为有毒,因为这些群体往往是网络仇恨的目标。这种对虚假相关性的过度依赖也导致系统难以检测隐性有毒语言。为缓解这些问题,我们创建了 ToxiGen,一个关于 13 个少数群体的 27.4 万条有毒与良性语句的大规模机器生成新数据集。我们开发了基于示例的提示框架与分类器在环对抗式解码方法,利用大规模预训练语言模型生成微妙的有毒与良性文本。以这种方式控制机器生成,使 ToxiGen 相比以往人工撰写文本资源,能更大规模地覆盖隐性有毒文本,并涉及更多人口群体。我们在 ToxiGen 的一个具有挑战性的子集上进行了人工评估,发现标注者难以区分机器生成文本与人工撰写语言。我们还发现 94.5% 的有毒样本被人工标注者标记为仇恨言论。利用三个公开可用数据集,我们表明在我们的数据上微调毒性分类器可显著提升其在人工撰写数据上的性能。我们还证明 ToxiGen 可用于对抗机器生成的有毒内容,因为微调在我们的评估子集上显著改进了分类器。我们的代码与数据可在 https://github.com/microsoft/ToxiGen 获取。
引用
@article{arxiv.2203.09509,
title = {ToxiGen: A Large-Scale Machine-Generated Dataset for Adversarial and Implicit Hate Speech Detection},
author = {Thomas Hartvigsen and Saadia Gabriel and Hamid Palangi and Maarten Sap and Dipankar Ray and Ece Kamar},
journal= {arXiv preprint arXiv:2203.09509},
year = {2022}
}
备注
Published as a long paper at ACL 2022. Code: https://github.com/microsoft/TOXIGEN