中文

因果测试 LLM 中的性别偏见:以职业偏见为例

计算与语言 2025-07-25 v4 机器学习

摘要

已有研究表明,大型语言模型生成的文本会表现出各种针对不同人群的类似人类的有害偏见。这些发现推动了旨在理解和衡量此类影响的研究工作。本文引入了一种用于生成式语言模型偏见测量的因果公式。基于这一理论基础,我们概述了设计稳健偏见基准的一系列要求。随后,我们提出了一个名为 OccuGender 的基准,并配有一套偏见测量流程,用于调查职业性别偏见。我们在 OccuGender 上测试了多个 SOTA 开源 LLM,包括 Llama、Mistral 及其指令微调版本。结果表明,这些模型表现出严重的职业性别偏见。最后,我们讨论了用于偏见缓解的提示策略,以及我们因果公式的扩展,以说明我们框架的泛化能力。我们的代码和数据见 https://github.com/chenyuen0103/gender-bias。

关键词

引用

@article{arxiv.2212.10678,
  title  = {Causally Testing Gender Bias in LLMs: A Case Study on Occupational Bias},
  author = {Yuen Chen and Vethavikashini Chithrra Raghuram and Justus Mattern and Rada Mihalcea and Zhijing Jin},
  journal= {arXiv preprint arXiv:2212.10678},
  year   = {2025}
}