中文

消除仇恨言论检测中的种族偏见

计算与语言 2020-05-26 v1

摘要

在当前的仇恨言论数据集中,标注者对毒性的感知与非裔美国人英语(AAE)的线索之间存在高度相关性。标注训练数据中的这种偏见以及机器学习模型放大该偏见的倾向,导致当前仇恨言论分类器常以较高的假阳性率将 AAE 文本误标为辱骂性/攻击性/仇恨言论。在本文中,我们使用对抗训练来缓解这种偏见,引入了一种能够检测有毒句子同时抑制与 AAE 文本相关的混杂因素的仇恨言论分类器。在仇恨言论数据集和 AAE 数据集上的实验结果表明,我们的方法能够大幅降低 AAE 文本的假阳性率,同时仅对仇恨言论分类性能产生极小影响。

关键词

引用

@article{arxiv.2005.12246,
  title  = {Demoting Racial Bias in Hate Speech Detection},
  author = {Mengzhou Xia and Anjalie Field and Yulia Tsvetkov},
  journal= {arXiv preprint arXiv:2005.12246},
  year   = {2020}
}

备注

Accepted at SocialNLP Workshop @ACL 2020