HateCheck:仇恨言论检测模型的功能测试
计算与语言
2021-09-09 v2
摘要
检测网络仇恨是一项困难任务,即便是最先进的模型也举步维艰。通常,仇恨言论检测模型通过在保留测试数据上测量准确率与F1分数等指标来评估。然而,该方法难以识别具体的模型弱点,且由于仇恨言论数据集中日益被证实的系统性缺口与偏差,还可能高估模型的可泛化性能。为提供更针对性的诊断洞察,我们引入HateCheck,一套面向仇恨言论检测模型的功能测试。我们基于既往研究综述及一系列与民间社会利益相关者的访谈,明确了29项模型功能。我们为每项功能精心构建测试用例,并通过结构化标注流程验证其质量。为展示HateCheck的效用,我们测试了接近最先进的transformer模型以及两个流行商业模型,揭示了关键的模型缺陷。
引用
@article{arxiv.2012.15606,
title = {HateCheck: Functional Tests for Hate Speech Detection Models},
author = {Paul Röttger and Bertram Vidgen and Dong Nguyen and Zeerak Waseem and Helen Margetts and Janet B. Pierrehumbert},
journal= {arXiv preprint arXiv:2012.15606},
year = {2021}
}
备注
Accepted at ACL 2021 (Main Conference)