中文

大语言模型如何计算口语置信度

计算与语言 2026-05-20 v3 人工智能 机器学习

摘要

口语置信度——即通过提示大语言模型以数字或类别形式表达其置信度——已广泛用于从黑箱模型中提取不确定性估计。然而,大语言模型如何内部生成此类置信度分数仍未为人所知。我们针对两个问题展开研究:首先,置信度是在请求时即时计算,还是在答案生成期间自动计算并缓存供后续检索;其次,口语置信度代表的是什么——是标记对数概率,还是对答案质量的更丰富评估?本文聚焦于 Gemma 3 27B(穿插 TriviaQA、BigMath 和 MMLU 数据集),以及 Qwen 2.5 7B 和推理模型 Magistral Small 24B,提供了关于缓存检索的一致证据。通过激活操控、补丁、加噪和置换实验,我们发现置信度表示在答案相邻位置出现,随后在口语化位置才呈现。注意力阻断实验指明信息流向:置信度从答案标记收集,缓存于首个答案后位置,然后检索以输出。关键的是,线性探针和方差分解揭示,这些缓存表示在口语置信度中解释的方差显著超出标记对数概率,表明这是一种更丰富的答案质量评估,而非简单的流畅度读取。这些发现表明,口语置信度反映的是自动化、精妙的自我评估——而非事后重构——并对理解大语言模型中的元认知及提高校准性具有启示意义。

关键词

引用

@article{arxiv.2603.17839,
  title  = {How do LLMs Compute Verbal Confidence},
  author = {Dharshan Kumaran and Arthur Conmy and Federico Barbero and Simon Osindero and Viorica Patraucean and Petar Veličković},
  journal= {arXiv preprint arXiv:2603.17839},
  year   = {2026}
}