隐蔽但未消除:基于姓名的偏差基准评估 LLM 中的国籍偏差
计算与语言
2025-07-24 v1
摘要
大型语言模型(LLM)即使在不存在显式人口统计标记的情况下,也可能表现出对特定国籍的潜在偏差。在本工作中,我们引入了一种基于姓名的新型基准测试方法,该方法衍生自 QA 偏差基准(BBQ)数据集,旨在研究将显式国籍标签替换为具有文化指示性的姓名所产生的影响,这一场景更贴近真实的 LLM 应用。我们的新方法考察了这种替换如何影响来自 OpenAI、Google 和 Anthropic 等行业领导者的各类 LLM 的偏差幅度和准确率。我们的实验表明,较小模型的准确率较低且表现出比较大型模型更多的偏差。例如,在我们的姓名数据集及模糊语境(即未揭示正确选择的语境)中,Claude Haiku 表现出的刻板偏差得分最差,为 9%,而其较大型对应模型 Claude Sonnet 仅为 3.5%,且后者在准确率上比前者高出 117.7%。此外,我们发现较小模型在这些模糊语境中保留了更大比例的现有错误。例如,在将姓名替换显式国籍引用后,GPT-4o 在模糊语境中保留了 68% 的错误率,而 GPT-4o-mini 为 76%,其他模型提供商也有类似发现。我们的研究强调了 LLM 中偏差的顽固韧性,突显了其在多元化全球背景下 AI 系统开发与部署的深远影响。
引用
@article{arxiv.2507.16989,
title = {Obscured but Not Erased: Evaluating Nationality Bias in LLMs via Name-Based Bias Benchmarks},
author = {Giulio Pelosio and Devesh Batra and Noémie Bovey and Robert Hankache and Cristovao Iglesias and Greig Cowan and Raad Khraishi},
journal= {arXiv preprint arXiv:2507.16989},
year = {2025}
}