大语言模型中的性别偏见与刻板印象
计算与语言
2023-08-30 v1 计算机与社会
机器学习
摘要
大语言模型(LLMs)在过去几个月中取得了实质性进展,在许多领域打破了最先进的基准。本文研究了 LLMs 在性别刻板印象方面的行为,这是先前模型的一个已知问题。我们使用一种简单的范式来测试性别偏见的存在,该范式基于但不同于 WinoBias(一个常用的性别偏见数据集,很可能被包含在当前 LLMs 的训练数据中)。我们测试了四个最近发布的 LLMs,并证明它们对男性和女性的职业表达了有偏见的假设。我们在本文中的贡献如下:(a)LLMs 选择刻板印象上符合某人性别的职业的可能性高出 3-6 倍;(b)这些选择更符合人们的感知,而非官方就业统计所反映的真相;(c)LLMs 实际上将偏见放大到超出感知或真相所反映的程度;(d)在我们的研究条目中,LLMs 95% 的时间忽略了句子结构中的关键歧义,但在被明确提示时,它们能识别该歧义;(e)LLMs 为其选择提供的解释事实不准确,并可能掩盖其预测背后的真实原因。也就是说,它们对其偏见行为提供了合理化。这凸显了这些模型的一个关键属性:LLMs 在不平衡的数据集上训练;因此,即使近期基于人类反馈的强化学习取得了成功,它们也倾向于将这些不平衡反射回我们。与其他类型的社会偏见一样,我们建议必须仔细测试 LLMs,以确保它们公平对待少数群体个人和社区。
引用
@article{arxiv.2308.14921,
title = {Gender bias and stereotypes in Large Language Models},
author = {Hadas Kotek and Rikker Dockum and David Q. Sun},
journal= {arXiv preprint arXiv:2308.14921},
year = {2023}
}
备注
ACM Collective Intelligence