自然语言推理中的性别偏见评估
计算与语言
2021-05-13 v1 机器学习
摘要
性别偏见刻板印象最近在自然语言处理中引发了重大的伦理关切。然而,通过推理在自然语言理解中检测和评估性别偏见的进展有限,需要进一步研究。在这项工作中,我们提出了一种评估方法,通过构建一个将性别中立前提与性别特定假设配对的挑战任务来衡量这些偏见。我们使用我们的挑战任务,借助职业调查在 MNLI 和 SNLI 数据集上训练的三种最先进 NLI 模型(BERT、RoBERTa、BART)是否存在性别刻板印象。我们的发现表明,这三种模型显著容易受到性别引发的预测错误的影响。我们还发现,诸如增强训练数据集以确保性别平衡的数据集等去偏技术在某些情形下有助于减少此类偏见。
引用
@article{arxiv.2105.05541,
title = {Evaluating Gender Bias in Natural Language Inference},
author = {Shanya Sharma and Manan Dey and Koustuv Sinha},
journal= {arXiv preprint arXiv:2105.05541},
year = {2021}
}
备注
NeurIPS 2020 Workshop on Dataset Curation and Security