分布式过程奖励模型:基于条件最优传输的未来奖励校准预测
机器学习
2026-05-13 v2 人工智能
摘要
推理时扩展方法依赖于过程奖励模型(PRM),而此类模型通常校准不佳且会高估成功概率。据我们所知,我们首次提出使用条件最优传输来校准 PRM,通过修改条件 OT(CondOT)映射学习 \cite{bunne2022supervised},以估计一个关于由 PRM 估计的成功概率的单调条件分位数函数,该函数以 PRM 隐藏状态为条件。这产生了结构上有效的分位数估计,并能够在任意水平上高效提取置信界,我们将其整合到 \cite{park2025know} 的实例自适应扩展(IAS)框架中。我们在涵盖中等难度问题(MATH-500)和更困难的分布外问题(AIME)的数学推理基准上进行评估。对于具有可靠排序信号的 PRM,我们的方法相较于未校准的 PRM 和分位数回归均显著改善了校准效果。在下游的 Best-of-N IAS 性能上,我们的方法总体上优于未校准的 PRM。这些结果确立了条件最优传输作为另一种原理明确且实用的 PRM 校准方法,提供了结构性保证与灵活的不确定性估计。
引用
@article{arxiv.2605.06785,
title = {Distributional Process Reward Models: Calibrated Prediction of Future Rewards via Conditional Optimal Transport},
author = {Rachel Ma and Dylan Hadfield-Menell and Kristjan Greenewald},
journal= {arXiv preprint arXiv:2605.06785},
year = {2026}
}