DreamPRM-Code:面向LLM编程的函数式步骤奖励模型及标签纠正
机器学习
2025-12-18 v1 人工智能
计算与语言
摘要
过程奖励模型(PRM)已成为通过测试时间扩展改进大型语言模型(LLM)的关键技术,但其在编码领域的有效性受限于代码缺乏有意义的步骤分解以及蒙特卡洛生成的部分标签噪声。我们提出DreamPRM-Code,一种面向编码的PRM方法,将函数视为推理步骤,通过链式函数提示策略诱导模块化代码生成,使PRM的训练与应用类似于数学推理任务。为解决标签噪声,DreamPRM-Code引入基于元学习的纠正机制,利用干净的最终解决方案单元测试标签,并通过双层优化细化中间标签。在测试时间扩展上应用后,DreamPRM-Code在LiveCodeBench上实现了80.9%的pass@1率,超越了OpenAI o4-mini。
引用
@article{arxiv.2512.15000,
title = {DreamPRM-Code: Function-as-Step Process Reward Model with Label Correction for LLM Coding},
author = {Ruiyi Zhang and Peijia Qin and Qi Cao and Pengtao Xie},
journal= {arXiv preprint arXiv:2512.15000},
year = {2025}
}