中文

BAS:评估大语言模型置信度的决策论方法

计算与语言 2026-04-06 v1

摘要

大型语言模型(LLMs)常常在 abstention 在所需时会更安全的情境下会产生自信但错误的答案。然而,标准的评估协议需要给出响应,不考虑置信度在不同风险偏好下的决策方式。为弥补这一差距,我们引入行为对齐得分(BAS),这是一种决策论度量,用于评估LLM置信度是否支持 abstention-aware 决策。BAS 来源于明确的答复或 abstain 效用模型,并聚合不同风险阈值下的实现效用,产生一个取决于置信度大小和排序的决策水平可靠性度量。我们在理论上表明,诚实的置信度估计唯一能最大化期望 BAS 效用,将校准与决策最优行为联系起来。BAS 与诸如对数损失等proper scoring rules 相关,但结构上有所不同:对数损失对低置信度和高置信度的惩罚是对称的,而 BAS 施加了非对称惩罚,强烈优先避免高置信度错误。我们使用 BAS 以及诸如准确率置信度等(ece)和 AURC 等广泛使用的度量,然后构建一个自报告置信度可靠性的基准,覆盖多个LLM和任务。我们的结果显示决策有用的置信度存在显著差异,尽管较大且更准确的模型倾向于获得更高的 BAS,即便是前沿模型也容易出现严重的高置信度。重要的是,BAS 类似的模型在 ECE 或 AURC 时可能表现出截然不同的 BAS,由于高度自信的错误,凸显了标准度量的局限性。我们进一步表明,诸如 top-k 置信度 elicitation 和事后校准等简单干预可以显著改善置信度的可靠性。总体而言,我们的工作提供了原则性的度量和全面的基准,用于评估LLM置信度的可靠性。

关键词

引用

@article{arxiv.2604.03216,
  title  = {BAS: A Decision-Theoretic Approach to Evaluating Large Language Model Confidence},
  author = {Sean Wu and Fredrik K. Gustafsson and Edward Phillips and Boyan Gao and Anshul Thakur and David A. Clifton},
  journal= {arXiv preprint arXiv:2604.03216},
  year   = {2026}
}

备注

24 pages, 7 figures, 6 tables