中文

大语言模型能否利用语言不确定性标记可靠地反映内在置信度?

计算与语言 2026-05-28 v1

摘要

大语言模型的语言表达置信度应忠实反映其内在不确定性。虽然近期研究表明大语言模型在以人类对齐的方式使用信念标记(如“它可能是...”)方面存在困难,但仍不清楚模型能否以稳定且可推广的方式将自身的语言置信度框架与特定置信度水平关联,以及具体语境特征如何影响这一能力。我们对此问题进行首次系统性研究,通过形式化“标记内部置信度”(MIC)作为模型在给定任务域中与特定信念标记关联的估计内在置信度。我们提出了7个度量指标,用于评估MIC在同一分布内及跨分布稳定性。将我们的分析框架应用于多样化的模型和任务后发现,尽管在模型中心化的标记意义解释下,大语言模型仍然存在忠实但未校准的问题,难以在跨分布间保持区分标记内部置信度的能力,尽管在任务间保持一定程度的一致排序。这为全面理解大语言模型中忠实校准问题提供了关键且补充性的证据,强调需要更对齐且更稳定的标记使用以提升可信度和可靠性。

关键词

引用

@article{arxiv.2605.28778,
  title  = {Can LLMs Use Linguistic Uncertainty Markers to Reliably Reflect Intrinsic Confidence?},
  author = {Gabrielle Kaili-May Liu and Arman Cohan},
  journal= {arXiv preprint arXiv:2605.28778},
  year   = {2026}
}

备注

Code: https://github.com/yale-nlp/marker_internal_confidence