仇恨言论与滥用语言数据集中的交叉偏见
计算与语言
2020-05-29 v3 社会与信息网络
摘要
算法被广泛用于检测社交媒体中的仇恨言论与滥用语言。我们调查了用于训练这些算法的人工标注数据是否存在偏见。我们利用一个公开可用的标注Twitter数据集(Founta et al. 2018),对99,996条推文的种族、性别和党派认同维度进行了分类。结果显示,非裔美国人推文被标注为滥用的可能性高达3.7倍,非裔美国男性推文被标注为仇恨的可能性比其他群体高出至多77%。这些模式具有统计显著性且在加入党派认同作为控制变量后依然稳健。本研究首次提供了关于仇恨言论与滥用语言数据集中交叉偏见的系统性证据。
引用
@article{arxiv.2005.05921,
title = {Intersectional Bias in Hate Speech and Abusive Language Datasets},
author = {Jae Yeon Kim and Carlos Ortiz and Sarah Nam and Sarah Santiago and Vivek Datta},
journal= {arXiv preprint arXiv:2005.05921},
year = {2020}
}