评估大语言模型中的性别偏见
计算与语言
2024-11-18 v1
摘要
人工智能中的性别偏见已成为一个重要问题,特别是在用于通信导向应用的语言模型背景下。本研究考察大语言模型(LLMs)在职业语境下代词选择中表现出的性别偏见程度。分析使用自建数据集评估 GPT-4、GPT-4o、PaLM 2 Text Bison 和 Gemini 1.0 Pro 等模型。所考虑的职业涵盖从男性占比显著到女性集中度显著,以及性别分布相对均衡的职业。采用三种不同的句子处理方法评估潜在性别偏见:掩码词元、非掩码句子和句子补全。此外,LLMs 还建议特定职业的人物姓名,随后考察其性别分布。结果显示,模型的代词选择与美国劳动力数据中的性别分布呈正相关。女性代词更常与女性主导职业关联,男性代词更常与男性主导职业关联。句子补全与实际性别分布的相关性最强,而姓名生成产生了更均衡的“政治正确”性别分布,尽管在以男性或女性为主的职业中仍存在显著差异。总体而言,提示方法对性别分布的影响大于模型选择本身,凸显了解决 LLMs 性别偏见的复杂性。研究结果强调了提示在性别映射中的重要性。
引用
@article{arxiv.2411.09826,
title = {Evaluating Gender Bias in Large Language Models},
author = {Michael Döll and Markus Döhring and Andreas Müller},
journal= {arXiv preprint arXiv:2411.09826},
year = {2024}
}
备注
13 pages, 12 figures, 1 table