多语言 HateCheck:面向多语言仇恨语音检测模型的功能测试
计算与语言
2022-06-22 v1
摘要
仇恨语音检测模型通常在留出测试集上进行评估。然而,由于仇恨语音数据集中日益被充分记录的系统性缺口与偏差,这有可能描绘出模型性能不完整且可能具误导性的图景。为了提供更针对性的诊断洞察,近期研究引入了针对仇恨语音检测模型的功能测试。然而,这些测试目前仅存在于英语内容,这意味着它们无法支持世界上数十亿人使用的其他语言中更有效模型的开发。为帮助解决此问题,我们引入了 Multilingual HateCheck (MHC),一套面向多语言仇恨语音检测模型的功能测试。MHC 覆盖十种语言中的 34 项功能,其语言数量多于任何其他仇恨语音数据集。为说明 MHC 的效用,我们训练并测试了一个高性能的多语言仇恨语音检测模型,并揭示了其在单语与跨语言应用中的关键模型弱点。
引用
@article{arxiv.2206.09917,
title = {Multilingual HateCheck: Functional Tests for Multilingual Hate Speech Detection Models},
author = {Paul Röttger and Haitham Seelawi and Debora Nozza and Zeerak Talat and Bertie Vidgen},
journal= {arXiv preprint arXiv:2206.09917},
year = {2022}
}
备注
Accepted at WOAH (NAACL 2022)