GR-Ben:用于评估过程奖励模型的通用推理基准
人工智能
2026-05-08 v2 计算与语言
摘要
当前,过程奖励模型(PRMs)在 test-time scaling 上展现出巨大的潜力。由于大型语言模型(LLMs)在解决广泛的推理和决策任务时经常生成有缺陷的中间推理步骤,PRMs 需要具备检测现实场景中过程级错误的能力。然而,现有的基准主要聚焦于数学推理,无法全面评估 PRMs 在 diverse reasoning 场景中的错误检测能力。为缓解这一差距,我们引入 GR-Ben,这是一个专为评估 PRM 在两个主要推理领域(science 和 logic)以及九个子领域中性能而设计的过程级基准。我们对包括 22 个模型在内的 diverse 模型集合进行大规模实验,得出两个关键发现:(1) 在数学推理之外的领域,现有 PRMs 和 LLMs 的错误检测能力显著较弱。(2) 总体而言,PRMs 在识别知识型错误方面不如人,而 LLMs 在检测计算型错误方面表现较差。我们希望 GR-Ben 能促进未来在 PRMs 通用领域的研究,从而提升 LLMs 的推理能力。
引用
@article{arxiv.2605.01203,
title = {GR-Ben: A General Reasoning Benchmark for Evaluating Process Reward Models},
author = {Zhouhao Sun and Xuan Zhang and Xiao Ding and Bibo Cai and Li Du and Kai Xiong and Xinran Dai and Fei Zhang and weidi tang and Zhiyuan Kan and Yang Zhao and Bing Qin and Ting Liu},
journal= {arXiv preprint arXiv:2605.01203},
year = {2026}
}