中文

更多女性、相同刻板印象:揭示大型语言模型中的性别偏见悖论

计算与语言 2026-03-10 v4 人工智能

摘要

大型语言模型 (LLM) 已彻底变革了自然语言处理,但关于其倾向于反映或放大社会偏见的担忧仍然存在。本研究引入一种新颖的评估框架来揭示 LLM 中的性别偏见:利用自由形式的讲故事来暴露模型中嵌入的偏见。对十个突出 LLM 进行系统性分析显示,这些模型在职业中持续高代表制女性角色,可能是由于监督微调 (SFT) 和来自人类反馈的强化学习 (RLHF)。悖论的是,尽管这些模型高代表制女性角色,但其产出的职业性别分布更接近人类刻板印象而非真实世界劳动数据。这凸显了实施平衡缓解措施以促进公平性并防止建立潜在新偏见的挑战与重要性。我们将在 GitHub 上发布提示词及 LLM 生成的故事。

关键词

引用

@article{arxiv.2503.15904,
  title  = {More Women, Same Stereotypes: Unpacking the Gender Bias Paradox in Large Language Models},
  author = {Evan Chen and Run-Jun Zhan and Yan-Bai Lin and Hung-Hsuan Chen},
  journal= {arXiv preprint arXiv:2503.15904},
  year   = {2026}
}