中文

分支再思考奖励模型:Think Twice 推理奖励建模

计算与语言 2026-01-30 v3

摘要

大语言模型 (LLM) 越来越依赖思考模型,通过外部化中间步骤来分配额外推理计算,思考再思考策略表明第二轮审慎推理可激发更强的推理能力。相比之下,大多数奖励模型 (RM) 仍将许多质量维度压缩到单一标量的“一锤子”设计,这导致判断扩散:注意力在评估标准之间传播,造成关注力不集中和浅层分析。我们引入分支再思考 (BR-RM),一种两轮的 RM,将思考再思考原则引入奖励建模。第一轮执行自适应分支,选择一小组实例关键维度(如事实性和安全性),并勾勒简洁的、以证据为导向的假设。第二轮执行分支条件化的再思考,对这些假设进行针对性复盘,审查最重要的事项。我们采用基于 GRPO 的强化学习进行训练,针对结构化的两轮轨迹进行训练,仅使用简单的二元结果奖励并严格检查格式,使该方法与标准 RLHF 流程兼容。通过将一次性评分转换为聚焦、第二轮推理,BR-RM 减少了判断扩散,提高了对细微但关键性错误的敏感性,同时保持实用和可扩展。实验结果表明,我们的模型在三个具有挑战性的奖励建模基准(涵盖多个领域)上实现了最先进性能。

关键词

引用

@article{arxiv.2510.23596,
  title  = {Think Twice: Branch-and-Rethink Reasoning Reward Model},
  author = {Yizhu Jiao and Jiaqi Zeng and Julien Veron Vialard and Oleksii Kuchaiev and Jiawei Han and Olivier Delalleau},
  journal= {arXiv preprint arXiv:2510.23596},
  year   = {2026}
}

备注

Source Code: https://github.com/yzjiao/BR-RM. Model Checkpoints: https://huggingface.co/nvidia/Qwen3-Nemotron-14B-BRRM and https://huggingface.co/nvidia/Qwen3-Nemotron-8B-BRRM