中文

LLM 决策是否忠实于 Verbal Confidence?

机器学习 2026-01-13 v1 计算与语言

摘要

大型语言模型(LLM)能够产生意想不到的精妥的自不确定性估计。然而,仍不清楚这种表达的置信度与模型的推理、知识或决策过程有多大程度的关联。为此,我们引入了 RiskEval\textbf{RiskEval}:一个用于评估模型在不同错误惩罚下,其自我放弃政策是否得到调整的框架。我们对几款前沿模型进行评估,发现存在关键性 dissociation:模型在表述自己的 verbal 置信度时既不具备成本意识,也不具备在高惩罚条件下决定是否参与的战略响应能力。即便在极端惩罚下,频繁放弃成为数学上最优策略时,模型几乎从不放弃,导致效用崩溃。这表明,校准后的 verbal 置信度得分可能不足以构建可信且可解释的 AI 系统,因为当前模型缺乏将不确定性信号转化为最优和风险敏感决策的战略能量。

关键词

引用

@article{arxiv.2601.07767,
  title  = {Are LLM Decisions Faithful to Verbal Confidence?},
  author = {Jiawei Wang and Yanfei Zhou and Siddartha Devic and Deqing Fu},
  journal= {arXiv preprint arXiv:2601.07767},
  year   = {2026}
}