信任但验证:证明者-验证者 deliberation for selective LLM prediction
人工智能
2026-05-26 v1 计算与语言
摘要
可靠地知道语言模型何时正确几乎与正确本身一样重要。我们引入证明者-验证者 deliberation(PVD),这是一种基于交互式证明论的推理时间协议,作为选择性预测的机制:该协议同时产生答案和结构化的置信度裁决,使系统能够报告高置信度的答案,同时对不确定的案例保持谨慎。在每次对话中,证明者通过可检查的子论点来捍卫候选答案,而验证者则提出有针对性的挑战并返回 \textsc{Accept}、\textsc{Challenge} 或 \textsc{Reject}。由于冻结的语言模型是对噪声信道上 imperfect 的证明者和验证者,形式上的完备性和可靠性保证并不直接转移;相反,我们通过其覆盖-精度行为来经验性地刻画该协议。我们的主要实验使用 Claude Sonnet 4.6 作为证明者,Claude Haiku 4.5 作为验证者,在 GPQA Diamond 上进行。使用无答案修订接受的问题(称为 Accept + No Change, ANC)被报告为高置信度子集;我们评估了该子集的精度和覆盖率。ANC 将可靠答案与不可靠答案区分开来,实现了约 30 平分之一的 HC-Prec 间隙。与自洽性、通用自洽性、多智能体辩论和 Reflexion 的比较表明,证明者-验证者 deliberation 为选择性预测提供了一种独特的论证可信度信号。
引用
@article{arxiv.2605.25133,
title = {Trust but Verify: Prover-Verifier Deliberation for Selective LLM Prediction},
author = {João Sedoc and Baotong Zhang and Dean Foster},
journal= {arXiv preprint arXiv:2605.25133},
year = {2026}
}