降低仇恨言论检测器中的目标群体偏差
计算与语言
2021-12-08 v1
摘要
在线论坛上攻击性与仇恨内容的普遍存在,使得需要能够跨目标群体胜任地检测此类内容的自动解决方案。本文中我们表明,在大型公开数据集上训练的文本分类模型尽管具有较高整体性能,却可能在若干受保护群体上显著表现不佳。在 \citet{vidgen2020learning} 数据集上,我们发现对标注不足的 Black Women 目标群体准确率降低 37%,对 Immigrants 降低 12%,其后仇恨言论涉及独特风格。为此,我们提出执行 token 级仇恨义消歧,并利用 token 的仇恨义表示进行检测,以建模更通用的信号。在两个公开数据集上,我们观察到模型在各目标群体间准确率的方差至少下降 30%,平均目标群体性能提升 4%,最差情形性能提升 13%。
引用
@article{arxiv.2112.03858,
title = {Reducing Target Group Bias in Hate Speech Detectors},
author = {Darsh J Shah and Sinong Wang and Han Fang and Hao Ma and Luke Zettlemoyer},
journal= {arXiv preprint arXiv:2112.03858},
year = {2021}
}