HateModerate:针对内容审核策略测试仇恨言论检测器
软件工程
2024-03-20 v2 计算与语言
摘要
为保护用户免受海量仇恨内容侵害,已有研究探讨了自动化仇恨言论检测。尽管已有诸多努力,一个问题仍然存在:自动化仇恨言论检测器是否符合社交媒体内容策略?平台的内容策略是该社交媒体平台所审核内容的清单。由于内容审核规则通常具有独特性,现有仇恨言论数据集无法直接回答此问题。本文旨在通过创建 HateModerate(一个用于测试自动化内容审核器相对于内容策略行为的数据集)来回答该问题。首先,我们让 28 名标注人员和 GPT 参与一个六步标注流程,得到与 Facebook 41 项仇恨言论策略逐一对应的仇恨与非仇恨测试套件。其次,我们针对 HateModerate 测试了最先进仇恨言论检测器的性能,揭示了这些模型在符合策略方面的重大失败。第三,利用 HateModerate,我们扩充了 HuggingFace 上一个下载量最高的仇恨检测器的训练数据。我们观察到模型对内容策略的符合度显著提升,同时在原始测试数据上得分相当。我们的数据集与代码见附件。
引用
@article{arxiv.2307.12418,
title = {HateModerate: Testing Hate Speech Detectors against Content Moderation Policies},
author = {Jiangrui Zheng and Xueqing Liu and Guanqun Yang and Mirazul Haque and Xing Qian and Ravishka Rathnasuriya and Wei Yang and Girish Budhrani},
journal= {arXiv preprint arXiv:2307.12418},
year = {2024}
}
备注
NAACL 2024 Finding