更小的模型,更聪明的奖励:面向过程奖励与结果奖励的双侧方法
人工智能
2025-12-11 v3 机器学习
软件工程
摘要
生成高质量代码仍是大型语言模型(LLM)面临的挑战。对于该任务上的推理模型演进,奖励模型是一个必要的中间步骤。这些模型评估结果或中间步骤。通过引入回归层和监督微调,仅包含解码器的Transformer模型可被转化为奖励模型。虽然已知反思能力通常随模型规模而增长,但我们想探讨规模更小的语言模型(如Phi-4系列)是否可以作为兼顾过程奖励与结果奖励的可用奖励模型。为实现此目标,我们构建了一个包含来自APPS编码挑战基准派生正确性标签的代码样本数据集。随后,我们训练了一个价值头模型来估计中间输出的成功概率。我们的评估表明,小型LLM能够作为有效的奖励模型或代码评估评姆,成功地在多个候选方案中识别正确解。使用该评姆,我们在从多个生成中挑选出最准确的代码的搜索能力上实现了超过20%的改进。
引用
@article{arxiv.2510.23083,
title = {Smaller Models, Smarter Rewards: A Two-Sided Approach to Process and Outcome Rewards},
author = {Jan Niklas Groeneveld and Xi Qin and Alexander Schaefer and Yaad Oren},
journal= {arXiv preprint arXiv:2510.23083},
year = {2025}
}
备注
Accepted and presented at NeurIPS 2025 Workshop: Foundations of Reasoning in Language Models