知道你不知道的:过程奖励模型的不确定性校准
机器学习
2025-11-10 v2 人工智能
机器学习
摘要
过程奖励模型(PRM)在引导大型语言模型(LLM)的推理时扩展算法中扮演核心角色。然而,我们观察到即使最先进的 PRM 也可能校准不佳。具体而言,它们倾向于高估部分推理步骤将导向正确答案的成功概率,尤其是在使用较小 LLM 完成推理轨迹时尤为明显。为解决这一问题,我们提出一种通过分位数回归进行的校准方法,用于调整 PRM 输出以更好地对齐真实成功概率。利用这些校准后的成功估计及其对应的置信界,我们引入了一个实例自适应扩展(IAS)框架,根据部分推理轨迹产生正确答案的估计可能性动态调整计算预算。与传统方法为每个查询分配固定数量的推理轨迹不同,该方法在使用校准后的 PRM 时能够针对每个实例和推理步骤进行自适应调整。在数学推理基准上的实验表明:(i) 我们的 PRM 校准方法实现了较小的校准误差,优于基线方法;(ii) 校准对于实现有效的 IAS 至关重要;(iii) 所提出的 IAS 策略在保持最终答案准确率的同时降低了推理成本,如预期那样对更有信心的问题使用更少的计算资源。
引用
@article{arxiv.2506.09338,
title = {Know What You Don't Know: Uncertainty Calibration of Process Reward Models},
author = {Young-Jin Park and Kristjan Greenewald and Kaveh Alim and Hao Wang and Navid Azizan},
journal= {arXiv preprint arXiv:2506.09338},
year = {2025}
}
备注
Accepted at NeurIPS 2025