全局 XAI 方法能否揭示大语言模型中注入的偏见?SHAP 对比规则提取对比 RuleSHAP
人工智能
2025-09-24 v2 机器学习
摘要
大语言模型(LLM)可能放大错误信息,破坏联合国可持续发展目标等社会目标。我们研究了错误信息的三个已知驱动因素(效价框架、信息过载和过度简化),这些因素通常受个人默认信念的影响。基于 LLM 编码此类默认信念(例如,“快乐是积极的”,“数学是复杂的”)并可作为“启发式集合”的证据,我们提出一个问题:能否从 LLM 中恢复出误导性行为背后基于信念的通用启发式规则,并以清晰的规则形式呈现?一个关键障碍是,可解释人工智能(XAI)中的全局规则提取方法是为数值输入/输出而非文本构建的。我们通过引出全局 LLM 信念并通过统计可靠的抽象将其映射到数值分数来解决此问题,从而使现成的全局 XAI 能够检测 LLM 中与信念相关的启发式。为了获得真实基准,我们通过系统指令将复杂度递增的硬编码偏见诱导非线性启发式(单变量、合取、非凸)注入流行的 LLM(ChatGPT 和 Llama)。通过这种方式,我们发现 RuleFit 对非单变量偏见的检测不足,而全局 SHAP 能更好地近似合取偏见,但无法产生可操作的规则。为了弥合这一差距,我们提出了 RuleSHAP,这是一种将全局 SHAP 值聚合与规则归纳相结合的规则提取算法,以更好地捕捉非单变量偏见,在启发式检测方面平均比 RuleFit 提高了 +94%(MRR@1)。我们的结果为揭示 LLM 中信念驱动的偏见提供了一条实用途径。
引用
@article{arxiv.2505.11189,
title = {Can Global XAI Methods Reveal Injected Bias in LLMs? SHAP vs Rule Extraction vs RuleSHAP},
author = {Francesco Sovrano},
journal= {arXiv preprint arXiv:2505.11189},
year = {2025}
}