中文

检测有毒语言数据集中的非预期社会偏见

计算与语言 2022-10-24 v1

摘要

随着网络仇恨言论的增多,将仇恨言论、攻击性文本的自动检测作为自然语言处理任务正日益流行。然而,极少有研究致力于从这些有毒语言数据集中检测非预期社会偏见。本文引入了一个名为 ToxicBias 的新数据集,其精选自 Kaggle 竞赛“Jigsaw 毒性分类中的非预期偏见”的现有数据集。我们旨在检测社会偏见、其类别及目标群体。该数据集包含标注了五种不同偏见类别的样本,即性别、种族/民族、宗教、政治与 LGBTQ。我们使用所整理的数据集训练基于 Transformer 的模型,并报告了偏见识别、目标生成与偏见隐含的基线性能。模型偏见及其缓解亦被详细讨论。我们的研究推动了从有毒语言数据集中系统性抽取社会偏见数据。本工作中实验所用的全部代码与数据集均已公开可用。

关键词

引用

@article{arxiv.2210.11762,
  title  = {Detecting Unintended Social Bias in Toxic Language Datasets},
  author = {Nihar Sahoo and Himanshu Gupta and Pushpak Bhattacharyya},
  journal= {arXiv preprint arXiv:2210.11762},
  year   = {2022}
}