中文

迈向有毒语言检测标注中的性别平等表征

计算与语言 2021-06-07 v1 人工智能 机器学习

摘要

分类器倾向于传播其训练数据中所存在的偏见。因此,理解标注者的 demographic 身份如何影响最终模型的公平性十分重要。本文中,我们关注男性和女性标注有毒评论方式的差异,探究这些差异如何导致放大男性标注者观点的模型。我们发现 BERT 模型将含有冒犯性词汇的有毒评论与男性标注者相关联,致使模型将 67.7% 的有毒评论预测为是由男性标注的。我们表明,通过从训练数据中移除冒犯性词汇和高毒性评论,可缓解这种性别预测间的差异。随后我们将习得的性别与语言间关联应用于有毒语言分类器,发现仅基于女性标注数据训练的模型比仅基于男性标注数据训练的模型性能好 1.8%,且在移除所有冒犯性词汇后训练模型可使模型偏见降低 55.5%,同时将灵敏度提高 0.4%。

关键词

引用

@article{arxiv.2106.02183,
  title  = {Towards Equal Gender Representation in the Annotations of Toxic Language Detection},
  author = {Elizabeth Excell and Noura Al Moubayed},
  journal= {arXiv preprint arXiv:2106.02183},
  year   = {2021}
}

备注

Paper is accepted at GeBNLP2021 workshop at ACL-IJCNLP 2021