初始选择的过度自信与批评下的不自信如何调节大语言模型的变更思维
机器学习
2025-07-08 v1 人工智能
摘要
大语言模型 (LLM) 表现出极具冲突性的行为:它们在初始答案上似乎坚定地过度自信,同时却容易在受到挑战时产生过度怀疑。为调查这一看似矛盾的现象,我们发展了一种新颖的实验范式,利用 LLM 能够在不记忆其初始判断的情况下获取置信度估计的独特能力——这是人类参与者不可能做到的。我们展示了 LLM——Gemma 3、GPT4o 和 o1-preview—— exhibit a 显著的选择支持偏差,该偏差强化并提升其对答案置信度的估计,导致对改变想法的显著抵抗。我们进一步演示了 LLM 对不一致建议的敏感度显著高于一致建议,这种行为在定性上偏离规范的贝叶斯更新。最后,我们证明,这两种机制——维持与先前承诺一致性的驱动力以及对相互矛盾反馈的过度敏感——单调地捕获了 LLM 在不同领域的行为。总体而言,这些发现为 LLM 置信度提供了机制性解释,解释了它们既顽固又对批评过度敏感的行为。
引用
@article{arxiv.2507.03120,
title = {How Overconfidence in Initial Choices and Underconfidence Under Criticism Modulate Change of Mind in Large Language Models},
author = {Dharshan Kumaran and Stephen M Fleming and Larisa Markeeva and Joe Heyward and Andrea Banino and Mrinal Mathur and Razvan Pascanu and Simon Osindero and Benedetto de Martino and Petar Velickovic and Viorica Patraucean},
journal= {arXiv preprint arXiv:2507.03120},
year = {2025}
}
备注
41 pages