推理不够:检查 LLM 中的事实偏误与迎合偏差
计算与语言
2025-09-30 v2 人工智能
摘要
尽管大语言模型 (LLM) 在事实核查、内容审核和高风险决策中广泛应用,但作为真理裁判的 LLM 仍鲜有了解。本研究报告了迄今为止规模最大的 LLM 可信度检测能力评估,并首次分析了这些能力在推理模型中的表现。我们让八个 LLM 对多个提示做出 4800 项可信度判断,比较了推理模型与非推理模型。我们发现,事实偏误(即无论实际是否为真,都倾向于相信陈述为真的概率)在推理模型中低于非推理模型,但仍高于人类基准。更令人担忧的是,我们识别出几个先进模型(来自 OpenAI 的 o4-mini 和 GPT-4.1,来自 DeepSeek 的 R1)存在迎合倾向,这些模型在检测准确度上表现出不对称——在事实准确性方面表现良好,但在欺骗准确性方面表现不佳。这表明,仅凭能力的进步并不能解决 LLM 中基本可信度检测挑战。
引用
@article{arxiv.2506.21561,
title = {Reasoning Isn't Enough: Examining Truth-Bias and Sycophancy in LLMs},
author = {Emilio Barkett and Olivia Long and Madhavendra Thakur},
journal= {arXiv preprint arXiv:2506.21561},
year = {2025}
}
备注
Published at the ICML 2025 Workshop on Models of Human Feedback for AI Alignment