LLM是否共享人类类似偏见?基于先验知识、无关上下文和不同计算预算的因果推理
人工智能
2026-03-16 v2
摘要
大型语言模型(LLM)在需要因果推理的领域日益受到使用,但其判断是反映规范性因果计算、人类类似捷径,还是脆弱的模式匹配,尚不明确。我们对20多个LLM进行基准测试,针对11个由 collider 结构()形式化的因果判断任务进行匹配的人类基准测试。我们发现,一个小型可解释模型能够较好地压缩LLM的因果判断,而大多数LLM表现出比考虑潜在未被提及因素的人类更具规则性的推理策略。此外,大多数LLM未能反映人类典型的 collider 偏见,如弱解释消除和Markov违反。我们探讨了LLM在(i)语义抽象和(ii)提示过载(注入无关文本)下的因果判断鲁棒性,发现链式思维(CoT)对许多LLM而言能提升鲁棒性。总体而言,这种差异表明LLM可以在已知偏见不可取时补充人类,但其规则化推理在不确定性本质化时可能会失效——这凸显了为确保LLM安全、有效部署所需刻画LLM推理策略的必要性。
引用
@article{arxiv.2602.02983,
title = {Do LLMs Share Human-Like Biases? Causal Reasoning Under Prior Knowledge, Irrelevant Context, and Varying Compute Budgets},
author = {Hanna M. Dettki and Charley M. Wu and Bob Rehder},
journal= {arXiv preprint arXiv:2602.02983},
year = {2026}
}