中文

探讨大语言模型中的交叉性偏见:基于指代消解置信度差异

计算与语言 2025-08-12 v1 人工智能

摘要

大语言模型(LLMs)取得了令人瞩目的性能,推动其在招聘和录取等资源受限场景中广泛用作决策支持工具。然而,学界已达成共识,AI系统可能反映并加剧社会偏见,在关键社会语境中使用时引发基于身份的伤害。先前的研究在评估LLMs中不同语言推理任务中的人口统计差异方面奠定了坚实基础。本文扩展单轴公平性评估,以考察交叉性偏见,认识到当多维歧视交叉时,会形成独特的劣势模式。我们构建了一个新基准数据集WinoIdentity,通过向WinoBias数据集添加25个人口统计标记(跨10个属性,包括年龄、国籍和种族),并与二元性别交叉,产生245,700个提示,用于评估50种不同的偏见模式。聚焦于因代表不足而导致的遗漏性伤害,我们通过不确定性的视角来探讨偏见,提出一种称为Coreference Confidence Disparity的群体(不)公平性度量指标,用于衡量模型对某些交叉性身份比其他身份更具或更少信心。我们评估了五个最近发布的LLMs,发现在包括体型、性取向和社会经济地位等 various 人口统计属性上,信心差异可达40%,模型对双重劣势身份在反陈刻 setting中最为uncertain。意外的是,指代消解信心即使针对hegemonic或特权标记也会下降,表明LLMs的最近卓越性能更可能源于记忆而非逻辑推理。值得注意的是,这两种价值对齐和有效性的独立失效可能相互叠加,导致社会伤害。

关键词

引用

@article{arxiv.2508.07111,
  title  = {Investigating Intersectional Bias in Large Language Models using Confidence Disparities in Coreference Resolution},
  author = {Falaah Arif Khan and Nivedha Sivakumar and Yinong Oliver Wang and Katherine Metcalf and Cezanne Camacho and Barry-John Theobald and Luca Zappella and Nicholas Apostoloff},
  journal= {arXiv preprint arXiv:2508.07111},
  year   = {2025}
}