BERT 中的性别偏见——通过真实下游分类任务中的情感评分度量与分析偏见
计算与语言
2023-06-28 v1 人工智能
计算机与社会
机器学习
摘要
预训练语言模型公开可用,并不断针对各种实际应用进行微调。随着它们能够掌握复杂的上下文信息,有害偏见很可能日益与这些模型交织在一起。本文分析了 BERT 模型中的性别偏见,主要贡献有二:第一,引入了一种新颖的偏见度量,将偏见定义为女性与男性样本版本在情感评价上的差异。第二,我们以真实的 IMDB 电影分类器为例,全面分析了 BERT 的偏见。通过系统性地改变训练流程的要素,我们能够就其对最终模型偏见的影响得出结论。比较了九种训练条件下的七种不同公开 BERT 模型,即总共 63 个模型。几乎所有条件都产生显著的性别偏见。结果表明,所反映的偏见源于公开 BERT 模型而非任务特定数据,这强调了负责任使用的重要性。
引用
@article{arxiv.2306.15298,
title = {Gender Bias in BERT -- Measuring and Analysing Biases through Sentiment Rating in a Realistic Downstream Classification Task},
author = {Sophie Jentzsch and Cigdem Turan},
journal= {arXiv preprint arXiv:2306.15298},
year = {2023}
}