LLM 是否存在性别(熵)偏见?
计算与语言
2026-03-16 v2 人工智能
摘要
我们调查了一些流行的 LLM 中特定类型性别偏见的存在性与持久性,并贡献了一个新的基准数据集 RealWorldQuestioning(已在 HuggingFace 上发布),该数据集由商业和健康背景下四个关键领域(教育、工作、个人财务管理以及一般健康)的真实问题开发而来。我们定义并研究了熵偏见,将其定义为 LLM 在回应用户提出的真实问题时所生成信息量的差异。我们使用四种不同的 LLM 测试了这一点,并利用 ChatGPT-4o(作为“LLM-as-judge”)对生成的回复进行了定性和定量评估。我们的分析(基于指标的对比和“LLM-as-judge”评估)表明,在类别层面上,LLM 对男性和女性的回复没有显著偏见。然而,在更细的粒度(单个问题层面)上,在大多数情况下,LLM 对男性和女性的回复存在显著差异,这些差异通常会相互“抵消”,因为某些回复对男性更好,反之亦然。这仍然是一个问题,因为这些工具的典型用户通常(仅)在这些常见但重要的生活领域中提出一个特定问题,而不是几个不同的问题。我们提出了一种简单的去偏见方法,该方法迭代地合并两种性别的回复以产生最终结果。我们的方法表明,一种简单的、基于提示的去偏见策略可以有效地消除 LLM 输出的偏见,从而在 78% 的情况下产生比两种性别变体信息含量都更高的回复,并在其余情况下始终实现平衡的整合。
引用
@article{arxiv.2505.20343,
title = {Do LLMs have a Gender (Entropy) Bias?},
author = {Sonal Prabhune and Balaji Padmanabhan and Kaushik Dutta},
journal= {arXiv preprint arXiv:2505.20343},
year = {2026}
}
备注
18 pages, 4 figures