中文

你到底知道自己知道什么?大语言模型的置信度并未与其行为保持一致

机器学习 2026-02-10 v3

摘要

大语言模型(LLMs)正在被部署于具有代理性和多轮工作流程中,任务是执行具有重大后果的行动。为了可靠地部署它们并管理这些情境下的风险结果,有助于获取模型的不确定性估计。然而,针对大语言模型的置信度获取方法通常不在代理性情境下进行评估;相反,它们是在静态数据集(如问答基准)上进行评估的。在本工作中,我们研究了在静态情境下获取的置信度估计与大语言模型在交互式情境下行为之间的关系。我们发现存在显著的行动-信念差距——大语言模型经常采取与其 solicited 置信度相矛盾的行动。在预测市场情境下,我们发现模型经常反对自己高置信度预测进行投注;在工具使用情境下,模型在其内部置信度较低时未能可靠地调用信息寻求工具;在用户挑战情境下,模型在对自己拥有高置信度答案时会更改答案,而对自己拥有低置信度答案则坚持不变。关键的是,我们展示了静态校准是不足以预测上述动态情境下一致性的有效 predictor,因为更强、更准确的模型有时在一致性方面不如其较小且较弱的开源对手。我们的结果凸显了当前评估方法ology 中的一个关键盲点:确保模型知道自己知道什么,并不保证它会在该知识上作出理性决策。

关键词

引用

@article{arxiv.2511.13240,
  title  = {Knowing What You Know Is Not Enough: Large Language Model Confidences Don't Align With Their Actions},
  author = {Arka Pal and Teo Kitanovski and Arthur Liang and Akilesh Potti and Micah Goldblum},
  journal= {arXiv preprint arXiv:2511.13240},
  year   = {2026}
}