名称变更影响裁决:基于干预一致性的 LLM 决策中的系统性偏差
计算与语言
2026-03-20 v1 人工智能
计算机与社会
机器学习
摘要
大型语言模型 (LLM) 正日益用于高风险决策,但其对虚假特征的敏感性仍未得到充分 characterize。我们引入 ICE-Guard 框架,通过应用干预一致性测试来检测三类虚假特征依赖:人口统计学 (名称/种族置换)、权威 (证据/声望置换) 和框架 (正面/负面重述)。在覆盖10个高风险领域的3000个情景中,我们评估了来自8个家族的11个 LLM,发现:(1) 权威偏差 (平均5.8%) 和框架偏差 (5.0%) 显著超过人口统计学偏差 (2.2%),挑战了该领域仅关注人口统计学的狭隘焦点;(2) 偏差集中在特定领域——金融显示22.6%的权威偏差,而刑事司法仅为2.8%;(3) 结构化分解,即 LLM 提取特征并由确定性规则决定,使翻转率降低最高可达100% (中位数为9个模型中的49%)。我们演示了一个 ICE 指导的 detect-diagnose-mitigate-verify 循环,通过迭代提示修补实现累计78%的偏差降低。与真实 COMPAS 犯罪复发数据进行的验证显示,COMPAS 派生的翻转率超过汇聚的合成翻转率,表明我们的基准对现实偏差提供保守估计。代码和数据已公开。
引用
@article{arxiv.2603.18530,
title = {When Names Change Verdicts: Intervention Consistency Reveals Systematic Bias in LLM Decision-Making},
author = {Abhinaba Basu and Pavan Chakraborty},
journal= {arXiv preprint arXiv:2603.18530},
year = {2026}
}