BiasCause: 评估大型语言模型的社会偏见因果推理
计算与语言
2026-03-12 v2
摘要
尽管大型语言模型(LLM)在社会中扮演着日益重要的角色,但研究表明它们持续生成反映针对敏感群体社会偏见的内容。现有基准能有效识别这些偏见,但在理解产生这些偏见的底层推理过程方面仍存在关键空白。本文通过评估 LLM 在回答带有社会偏见问题时的因果推理来填补这一空白。我们提出了一种形式化模式,将因果推理分为三类(错误推理、偏见推理和基于上下文的推理)。随后,我们合成了涵盖八种敏感属性的 1788 个问题,每组问题旨在探究特定类型的因果推理。所有问题均经人工验证,并要求 LLM 针对每个问题生成其答案背后的因果图。我们评估了四个最先进的 LLM,发现所有模型在大多数引发偏见推理的问题上均表现出有偏见的因果推理。此外,我们发现 LLM 还容易产生“错误-偏见”推理,即首先混淆相关性与因果性以推断敏感群体归属,随后应用有偏见的因果推理。通过考察 LLM 产生无偏见因果推理的案例,我们还识别了 LLM 用于避免偏见的三种策略(即明确拒绝回答、回避敏感属性以及添加上下文限制),为未来的去偏工作提供了启示。
引用
@article{arxiv.2504.07997,
title = {BiasCause: Evaluate Socially Biased Causal Reasoning of Large Language Models},
author = {Tian Xie and Tongxin Yin and Vaishakh Keshava and Xueru Zhang and Siddhartha Reddy Jonnalagadda},
journal= {arXiv preprint arXiv:2504.07997},
year = {2026}
}
备注
This work has been done when the first author is at Google. The first author is a student at the Ohio State University