中文

HateCheck:仇恨言论检测模型的功能测试

计算与语言 2021-09-09 v2

摘要

检测网络仇恨是一项困难任务,即便是最先进的模型也举步维艰。通常,仇恨言论检测模型通过在保留测试数据上测量准确率与F1分数等指标来评估。然而,该方法难以识别具体的模型弱点,且由于仇恨言论数据集中日益被证实的系统性缺口与偏差,还可能高估模型的可泛化性能。为提供更针对性的诊断洞察,我们引入HateCheck,一套面向仇恨言论检测模型的功能测试。我们基于既往研究综述及一系列与民间社会利益相关者的访谈,明确了29项模型功能。我们为每项功能精心构建测试用例,并通过结构化标注流程验证其质量。为展示HateCheck的效用,我们测试了接近最先进的transformer模型以及两个流行商业模型,揭示了关键的模型缺陷。

关键词

引用

@article{arxiv.2012.15606,
  title  = {HateCheck: Functional Tests for Hate Speech Detection Models},
  author = {Paul Röttger and Bertram Vidgen and Dong Nguyen and Zeerak Waseem and Helen Margetts and Janet B. Pierrehumbert},
  journal= {arXiv preprint arXiv:2012.15606},
  year   = {2021}
}

备注

Accepted at ACL 2021 (Main Conference)