中文

VERDI:基于分解推理的验证式 LLM 评判器的单次调用置信度估计

机器学习 2026-05-13 v1 计算与语言 信息检索

摘要

LLM-as-Judge 系统被广泛部署用于自动化评估,但实践者缺乏可靠的方法来判断何时应信任评判器的裁决。Token 对数概率是标准的事后置信度信号,但许多商业 LLM 无法提供,且即使可获取,在结构化 JSON 输出中也会饱和至 0.999 以上。我们提出 VERDI(VERification-Decomposed Inference,验证分解推理),该方法从结构化评判器已产生的推理轨迹中提取置信度,无需额外的推理调用。VERDI 将每次验证式评估分解为子检查,并导出三个结构信号:步骤-裁决对齐度(Step-Verdict Alignment)、声明级裕度(Claim-Level Margin)和证据基础得分(Evidence Grounding Score)。我们使用 Platt 缩放逻辑回归将其组合。在三个公开基准上,VERDI 在 GPT-4.1-mini 上实现了 0.72-0.91 的 AUROC,在 GPT-5.4-mini 上实现了 0.66-0.80。在 Qwen3.5-4B/9B/27B 上,其答案 token 对数概率是反校准的(错误时置信度更高,AUROC 为 0.32-0.49),而 VERDI 达到了 0.56-0.70。我们还在一个具有八个评估维度的生产系统上进行了验证(事实性维度上的 AUROC 为 0.73-0.88),展示了跨模型迁移能力(AUROC 为 0.66-0.69),并证明了一个 33M 参数的 NLI(自然语言推理)模型为正则表达式提取提供了可扩展的替代方案。

关键词

引用

@article{arxiv.2605.11334,
  title  = {VERDI: Single-Call Confidence Estimation for Verification-Based LLM Judges via Decomposed Inference},
  author = {Jasmine Qi and Danylo Dantsev and Muyang Sun},
  journal= {arXiv preprint arXiv:2605.11334},
  year   = {2026}
}

备注

16 pages, 6 figures