CogBias:测量与缓解大语言模型中的认知偏差
人工智能
2026-04-03 v1
摘要
大语言模型(LLM)越来越多地被部署在高风险决策环境中。虽然先前的工作表明LLM在行为上表现出认知偏差,但这些偏差是否对应于可识别的内部表征,以及是否可以通过有针对性的干预来缓解,仍然是一个悬而未决的问题。我们将LLM认知偏差定义为在具有可计算真实基线的任务中,系统性地、可重复地偏离正确答案,并引入了LLM CogBias,这是一个围绕四类认知偏差组织的基准:判断、信息处理、社会和响应。我们评估了三个LLM,发现认知偏差在所有四类中系统地出现,其幅度和去偏响应强烈依赖于类别:提示级别的去偏显著减少了响应偏差,但对判断偏差却适得其反。通过对比设计下的线性探针,我们表明这些偏差被编码为模型激活空间中线性可分离的方向。最后,我们应用激活引导来调节有偏差的行为,在25个基准测试上,将偏差分数(有偏差响应的比例)降低了26-32%,同时保持了下游能力(Llama:退化可忽略;Qwen:判断偏差最多下降-19.0个百分点)。尽管不同模型间的偏差表征近乎正交(平均余弦相似度0.01),但引导在不同架构间以相似速率降低了偏差(r(246)=.621, p<.001),这表明存在共享的功能组织。
引用
@article{arxiv.2604.01366,
title = {CogBias: Measuring and Mitigating Cognitive Bias in Large Language Models},
author = {Fan Huang and Songheng Zhang and Haewoon Kwak and Jisun An},
journal= {arXiv preprint arXiv:2604.01366},
year = {2026}
}