多维性别偏见分类
计算与语言
2020-05-05 v1
摘要
机器学习模型被训练以发现数据中的模式。NLP 模型在性别偏见文本上训练时可能无意中学到社会不良模式。本工作中,我们提出一个通用框架,沿若干语用与语义维度分解文本中的性别偏见:来自被谈论者性别的偏见、来自被对话者性别的偏见,以及来自说话者性别的偏见。利用这一细粒度框架,我们自动用性别信息标注了八个大规模数据集。此外,我们收集了一个新颖的、众包评价的语句级性别改写基准。区分多维度的性别偏见十分重要,因其使我们能训练更细粒度的性别偏见分类器。我们展示了我们的分类器对多种重要应用具有价值,例如控制生成模型中的性别偏见、检测任意文本中的性别偏见,并从性别角度阐明攻击性语言。
引用
@article{arxiv.2005.00614,
title = {Multi-Dimensional Gender Bias Classification},
author = {Emily Dinan and Angela Fan and Ledell Wu and Jason Weston and Douwe Kiela and Adina Williams},
journal= {arXiv preprint arXiv:2005.00614},
year = {2020}
}