SELFDOUBT:通过对冲-验证比率实现推理大语言模型的不确定性量化
人工智能
2026-04-09 v1
摘要
推理语言模型的不确定性估计在实际部署中仍然困难:基于采样的方法计算成本高昂,而常见的单遍代理方法(如口头化置信度或轨迹长度)在不同模型间往往不一致。对于既不暴露logits也不暴露中间token概率的专有推理API而言,这一问题更加严重,使从业者在推理时无法获得可靠的不确定性信号。我们提出SELFDOUBT,一个单遍不确定性框架,通过直接从推理轨迹中提取行为信号来解决这一僵局。我们的关键信号——对冲-验证比率(HVR)——检测推理轨迹是否包含不确定性标记,若包含,则检测这些标记是否被显式的自检行为所抵消。与需要多个采样轨迹或模型内部信息的方法不同,SELFDOUBT基于单条观测到的推理轨迹运行,使其适用于任何专有API在延迟和成本受限条件下的部署。我们在七个模型和三个多步推理基准(BBH、GPQA-Diamond和MMLU-Pro)上评估了SELFDOUBT。最值得注意的是,不包含对冲标记的轨迹有96%是正确的,揭示了一个零额外成本的高精度置信门。对于其余情况,完整的SELFDOUBT得分在推理成本降低10倍的情况下显著优于基于采样的语义熵。结合两个阶段的部署级联在无需任何任务特定标签的情况下达到了90%准确率和71%覆盖率。这些结果确立了SELFDOUBT作为面向专有推理模型的不确定性估计的可扩展、生产就绪基础。
引用
@article{arxiv.2604.06389,
title = {SELFDOUBT: Uncertainty Quantification for Reasoning LLMs via the Hedge-to-Verify Ratio},
author = {Satwik Pandey and Suresh Raghu and Shashwat Pandey},
journal= {arXiv preprint arXiv:2604.06389},
year = {2026}
}
备注
9 pages, 4 figures, 4 tables, plus appendix. Submitted to COLM 2026