中文

ReasonFlux-PRM:面向大语言模型中长链推理的轨迹感知PRM

计算与语言 2025-09-26 v2

摘要

过程奖励模型(PRMs)最近作为监督大语言模型(LLMs)中间推理步骤的强大框架而涌现。以往的PRMs主要在模型最终输出响应上进行训练,难以在以深度求索-R1等前沿推理模型生成的轨迹-响应输出格式中稳健地评估中间思维轨迹。在本工作中,我们引入ReasonFlux-PRM,一种专为评估轨迹-响应类型推理痕迹而设计的新型轨迹感知PRM。ReasonFlux-PRM融合了步骤级和轨迹级监督,实现了与结构化链式思维数据相匹配的细粒度奖励分配。我们将ReasonFlux-PRM适配支持离线和在线设置的奖励监督,包括(i)为下游监督式微调较小模型选择高质量模型蒸馏数据,(ii)为强化学习中的策略优化提供稠密的过程级奖励,以及(iii)实现奖励引导的最佳- N测试时扩展。在AIME、MATH500和GPQA-Diamond等具有挑战性的下游基准测试中,经验结果表明ReasonFlux-PRM-7B在数据质量选择方面优于强大的PRMs(如Qwen2.5-Math-PRM-72B)以及人类策展基准。此外,我们导出的ReasonFlux-PRM-7B实现了一致的性能提升,在监督式微调中实现12.1%的平均提升,在强化学习中实现4.5%的提升,在测试时扩展中实现6.3%的提升。我们还为资源受限的应用和边缘部署发布了高效的ReasonFlux-PRM-1.5B。项目:https://github.com/Gen-Verse/ReasonFlux

关键词

引用

@article{arxiv.2506.18896,
  title  = {ReasonFlux-PRM: Trajectory-Aware PRMs for Long Chain-of-Thought Reasoning in LLMs},
  author = {Jiaru Zou and Ling Yang and Jingwen Gu and Jiahao Qiu and Ke Shen and Jingrui He and Mengdi Wang},
  journal= {arXiv preprint arXiv:2506.18896},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025. Project: https://github.com/Gen-Verse/ReasonFlux