无需过程标签的自由过程奖励
机器学习
2024-12-04 v1 计算与语言
摘要
与其评估整个响应的收益模型(ORM)不同,过程奖励模型(PRM)按步骤对推理轨迹进行评分,提供更稠密和更细粒度的奖励。然而,训练 PRM 需要在每个中间步骤上标注标签,这在手工和自动数据收集方面 presents significant 挑战。本文旨在解决这一挑战。理论上和实证研究表明,无需额外成本即可获得 \textit{隐式 PRM},只需在较便宜的响应级别标签上训练 ORM。唯一的假设是将收益模型的参数化为策略模型和参考模型的对数似然比,这可以独立于特定损失目标进行优化。在实验中,我们使用各种目标函数实例化我们的隐式 PRM,并在 MATH 上对其性能进行评估。我们展示了我们的隐式 PRM 在训练数据量不足传统基于 MCTS 的基线 \textit{\'e la} Math-Shepherd 时表现更好。其性能可以通过多数投票进一步提升。我们进一步发现,扩大指令和响应的规模有助于我们的隐式 PRM,后者带来更大的收益。特别地,我们发现当使用交叉熵(CE)损失实例化我们的隐式 PRM 时,它更数据高效,即使只用一个响应训练也可以持续改进生成模型,这种设置在数据稀缺和不平衡的情况下尤为重要。进一步地,指令应与下游任务相关,而响应的多样性不带来收益。令人惊讶的是,训练额外的 Math-Shepherd 步骤标签对我们仅用结果数据训练的隐式 PRM 没有进一步的改进。我们希望本工作能促使人们重新思考 PRM 训练方法,为使 PRM 训练更易于获取做出贡献。
引用
@article{arxiv.2412.01981,
title = {Free Process Rewards without Process Labels},
author = {Lifan Yuan and Wendi Li and Huayu Chen and Ganqu Cui and Ning Ding and Kaiyan Zhang and Bowen Zhou and Zhiyuan Liu and Hao Peng},
journal= {arXiv preprint arXiv:2412.01981},
year = {2024}
}
备注
Models and data are available at: https://github.com/lifan-yuan/ImplicitPRM