通过推理轨迹测量黑盒置信度:几何特性、覆盖率与言语化
摘要
可靠的置信度估计使得通过纯文本 API 部署思维链(CoT)推理变得安全。然而,主流的黑盒基线方法——基于 K 个样本的自洽性——具有线性高昂的成本,且忽略了轨迹的几何特性。我们提出了一种黑盒轨迹置信度分数:我们将 CoT 嵌入为滑动窗口轨迹,并使用单参数 softmax 测量其向外部答案锚点的收敛程度。该方法无需 logits、隐藏状态或监督校准器。在 MedQA-USMLE、GPQA Diamond 和 MMLU-Pro 上使用 Gemini 3.1 Pro 和 Claude Sonnet 4.6 的六个(基准测试,推理器)设置中,在 K=4 时将该分数与覆盖率和言语化置信度通道融合,在 6/6 设置中实现了对 K=8 自洽性的 Pareto 改进(中位数 AUC 为 0.78 对 0.71,deltaAUC=+0.075)。固定选择控制(+0.060)和 E5 跨嵌入器复现排除了答案切换和单一供应商伪影的影响。几何特性在所有基准测试和推理器的倒数第二个窗口达到峰值,并在 GPQA Diamond 的终端窗口发生反转。三种无脚手架机制将黑盒置信度分离为裁判介导的覆盖率先验(C)、轨迹内几何特性(G)和条件言语化通道(V)。在 18 种基准测试 x 推理器 x 提议者设置中,C 和 G 在 18/18 和 16/18 种设置中提供独立信号,而 V 在 6/18 种设置中提供残差信号。将裁判从 GPT-5-mini 替换为 Claude Sonnet 4.6 后,仅 G 的 AUC 保持不变(|delta|<=0.013),仅 C 的 AUC 最多偏移 +/-0.02(kappa=0.82)。融合在 17/18 设置中优于最佳单一通道(中位数 AUC 为 0.78,最大值为 0.92)。
引用
@article{arxiv.2605.06308,
title = {Measuring Black-Box Confidence via Reasoning Trajectories: Geometry, Coverage, and Verbalization},
author = {Marc Boubnovski Martell and Josefa Lia Stoisser and Kaspar Märtens and Jialin Yu and Robert Kitchen and Philip Torr and Jesper Ferkinghoff-Borg},
journal= {arXiv preprint arXiv:2605.06308},
year = {2026}
}