中文

仇恨言论分类器习得类人的社会刻板印象

计算与语言 2021-10-29 v1 计算机与社会

摘要

社会刻板印象会对个体关于不同群体的判断产生负面影响,并可能在人们理解指向少数社会群体的语言方面起到关键作用。在此,我们通过考察个体标注者偏差与仇恨言论分类器对文本的错误分类之间的关系,评估社会刻板印象在仇恨语言自动检测中的作用。具体而言,在研究 1 中,我们调查新手标注者的刻板印象对其仇恨言论标注行为的影响。在研究 2 中,我们考察在大型标注语料库中语言内嵌的刻板印象对专家标注者聚合判断的影响。最后,在研究 3 中,我们展示了语言内嵌的刻板印象如何与神经网络仇恨言论分类器中的系统性预测错误相关联。我们的结果表明,仇恨言论分类器习得了类人的偏差,当其在大规模上传播时可能进一步加剧社会不平等。这一结合社会心理学与计算语言学方法的框架,为仇恨言论审核中偏差的额外来源提供了见解,并为关于机器学习公平性的持续讨论提供参考。

关键词

引用

@article{arxiv.2110.14839,
  title  = {Hate Speech Classifiers Learn Human-Like Social Stereotypes},
  author = {Aida Mostafazadeh Davani and Mohammad Atari and Brendan Kennedy and Morteza Dehghani},
  journal= {arXiv preprint arXiv:2110.14839},
  year   = {2021}
}