中文

基于 BERT 模型的社交媒体仇恨言论检测与种族偏见缓解

社会与信息网络 2021-01-27 v2 计算与语言 信息检索 机器学习

摘要

近来,仇恨和辱骂内容识别任务中与数据集及训练分类器相关的差异性偏见引起了诸多关注。尽管带有偏见的 abusive 语言检测数据集问题已被更频繁地讨论,但由训练分类器产生的偏见尚未成为关注焦点。在此,我们首先提出一种基于现有预训练语言模型 BERT 的迁移学习方法用于仇恨言论检测,并在两个公开可用的、标注了 Twitter 上种族主义、性别歧视、仇恨或攻击性内容的数据集上评估所提模型。接下来,我们在仇恨言论检测任务中引入一种偏见缓解机制,以在我们基于 BERT 的预训练模型微调过程中减轻训练集偏见的影响。为此,我们使用一种现有的正则化方法对输入样本重新加权,从而降低训练集中与类标签高度相关的 n-gram 的影响,然后用这些重新加权的样本微调我们的预训练 BERT 模型。为评估我们的偏见缓解机制,我们采用跨域方法,使用在上述数据集上训练的分类器来预测来自 Twitter 的两个新数据集(AAE-aligned 和 White-aligned 组,分别表示以非裔美国人英语 (AAE) 和标准美式英语 (SAE) 撰写的推文)的标签。结果表明训练分类器中存在系统性种族偏见,因为它们倾向于将 AAE-aligned 组中以 AAE 撰写的推文比 White-aligned 组中以 SAE 撰写的推文更频繁地分配给种族主义、性别歧视、仇恨和攻击性等负面类别。然而,在引入我们的偏见缓解机制后,分类器中的种族偏见显著减少。本工作可视为迈向去偏见仇恨言论和 abusive 语言检测系统的第一步。

关键词

引用

@article{arxiv.2008.06460,
  title  = {Hate Speech Detection and Racial Bias Mitigation in Social Media based on BERT model},
  author = {Marzieh Mozafari and Reza Farahbakhsh and Noel Crespi},
  journal= {arXiv preprint arXiv:2008.06460},
  year   = {2021}
}

备注

This paper has been accepted in the PLOS ONE journal in August 2020