中文

MedPRMBench:医学推理过程奖励模型的细粒度基准

计算与语言 2026-04-21 v1

摘要

过程级奖励模型(PRMs)是指导大型语言模型复杂推理的关键工具,而现有PRM基准仅覆盖数学等通用领域,无法满足医学推理的需求——医学推理独特地表现为安全性关键、知识密集性和多样化错误模式。没有可靠的医学PRM评估框架,无法量化模型在临床推理中的错误检测能力,使其在实际医疗保健应用中的安全性无法得到验证。我们提出MedPRMBench,这是首个针对医学领域的过程级奖励模型基准。基于临床推理蓝图(CRBs)的三阶段管道构建,MedPRMBench系统性地从七个医学问答来源生成高质量评估数据,覆盖14种细粒度错误类型,分为简单性、可靠性和敏感性三个类别,并首次引入4级严重程度分级系统以量化临床影响。该基准包含6,500个问题,伴随13,000条推理链和113,910条步骤级标签,另外包含6,879个问题用于训练。我们的医学PRM基线实现了87.1%的总体PRMScore——显著优于所有基线——并可作为即插即用的验证器,使下游医学问答准确率提高3.2-6.7个百分点。对专有旗舰模型、开源推理模型和医学专用模型的系统评估揭示了当前模型在医学推理错误检测能力方面的关键弱点,为未来PRM改进提供了清晰的方向。

关键词

引用

@article{arxiv.2604.17282,
  title  = {MedPRMBench: A Fine-grained Benchmark for Process Reward Models in Medical Reasoning},
  author = {Lingyan Wu and Xiang Zheng and Weiqi Zhai and Wei Wang and Xuan Ren and Zifan Zhang and Hu Wei and Bing Zhao},
  journal= {arXiv preprint arXiv:2604.17282},
  year   = {2026}
}