面向 LLM 偏见审计的可扩展实体基框架
计算与语言
2026-05-12 v2 人工智能
摘要
现有方法在大型语言模型(LLM)中进行偏见评估时在统计控制与生态有效性之间权衡,或依赖不贴近真实使用的人工提示,或依赖缺乏规模与严谨性的自然任务。我们引入一个可扩展的偏见审计框架,使用命名实体作为受控探针来衡量模型行为中的系统性差异。合成数据使我们能够构建多样且受控的输入,并表明该方法可靠地再现自然文本中观察到的偏见模式,支持大规模分析。利用该框架,我们进行了规模最大的偏见审计,涵盖19亿数据点,跨越多个实体类型、任务、语言、模型和提示策略。我们发现一致模式:模型对右派政治人物进行惩罚,偏好左派政治人物;偏好西方国家和较富裕的国家,而不青睐全球南方国家;偏好西方公司,而对防御和制药行业公司进行惩罚。虽然指令调校可减少偏见,但模型规模的增加会放大偏见,中文或俄语提示并不能缓解西方导向的偏好。这些发现凸显了在高风险应用中部署 LLM 前需要进行系统性偏见审计的必要性。我们的框架可扩展至其他领域和任务,我们也公开源代码以支持未来工作。
引用
@article{arxiv.2601.12374,
title = {A Scalable Entity-Based Framework for Auditing Bias in LLMs},
author = {Akram Elbouanani and Aboubacar Tuo and Adrian Popescu},
journal= {arXiv preprint arXiv:2601.12374},
year = {2026}
}