利用自生成干扰项校准言语化置信度
计算与语言
2026-03-03 v2 人工智能
摘要
经过校准的置信度估计对于大型语言模型(LLM)输出能够被人类用户所信任是必要的。虽然 LLM 能够以人类可解释的方式表达其置信度,但经验发现,LLM 生成的言语化置信度分数存在误校准,在准确率较低的实例上报告高置信度,从而损害了信任与安全。我们假设这种过度自信通常源于给定 LLM 在面对其编码极少信息的声明时表现出的高度易受暗示性;我们通过经验验证了这一假设,发现在准确率较低的声明上易受暗示性更强。基于这一发现,我们引入了干扰项归一化一致性(DINCO),该方法通过让模型在多个自生成干扰项(即替代声明)上独立表达其置信度,并根据总言语化置信度进行归一化,来估计并消除 LLM 的易受暗示性偏差。为了进一步改进校准,我们利用生成器-验证器分歧,将归一化的验证器置信度与基于一致性的生成器置信度估计相结合。在此,我们将流行的自一致性方法构建为利用采样生成间的一致性,将归一化的言语化置信度构建为利用对不相容声明验证间的一致性,从而允许我们将这些互补的一致性维度整合到 DINCO 中。此外,我们的分析表明,DINCO 提供了饱和度更低——因此更具可用性——的置信度估计,并且仅靠进一步采样无法弥合 DINCO 与基线之间的差距,在 10 次推理调用下的 DINCO 优于在 100 次调用下的自一致性。
引用
@article{arxiv.2509.25532,
title = {Calibrating Verbalized Confidence with Self-Generated Distractors},
author = {Victor Wang and Elias Stengel-Eskin},
journal= {arXiv preprint arXiv:2509.25532},
year = {2026}
}
备注
ICLR 2026. Code: https://github.com/victorwang37/dinco