中文

大型语言模型中的交叉公平性

计算与语言 2026-04-24 v2

摘要

大型语言模型 (LLMs) 越来越多地部署在社会敏感环境中,这引发了关于公平性和偏见的担忧,尤其是在交叉人口统计属性方面。在本文中,我们使用来自两个基准数据集的模糊和消歧上下文,系统地评估了六个 LLM 中的交叉公平性。我们通过跨上下文以及否定和非否定问题极性的多次运行分析,使用偏见分数、子组公平性指标、准确性和一致性来评估 LLM 行为。我们的结果表明,虽然现代 LLM 在模糊上下文中通常表现良好,但由于稀疏的非未知预测,这限制了公平性指标的信息量。在消歧上下文中,LLM 的准确性受到刻板印象对齐的影响,当正确答案强化刻板印象时,模型比当答案与之矛盾时更准确。这种模式在种族-性别交叉中尤为明显,其中对刻板印象的方向性偏见更强。子组公平性指标进一步表明,尽管在某些情况下观察到的差异很小,但结果分布在交叉组之间仍然不均衡。在重复运行中,响应的一致性也各不相同,包括与刻板印象对齐的响应。总体而言,我们的发现表明,模型表面的能力部分与刻板印象一致的线索相关,并且没有评估的 LLM 能在交叉设置中实现始终可靠或公平的行为。这些发现强调了超越准确性的评估需求,强调了在交叉组、情境和重复运行中结合偏见、子组公平性和一致性指标的重要性。

关键词

引用

@article{arxiv.2604.20677,
  title  = {Intersectional Fairness in Large Language Models},
  author = {Chaima Boufaied and Ronnie De Souza Santos and Ann Barcomb},
  journal= {arXiv preprint arXiv:2604.20677},
  year   = {2026}
}