PRIME:面向数学与工程中可验证推理的过程-结果对齐基准
计算与语言
2026-02-13 v1
摘要
虽然基于模型的验证器对于扩展具有可验证奖励的强化学习至关重要,但当前以结果为中心的验证范式主要关注最终结果与真实值之间的一致性,常常忽略推导过程中可能存在的错误。这导致对从错误推导中产生的正确答案赋予正奖励。为弥补这一差距,我们引入了 PRIME,这是一个用于评估验证器在数学与工程领域进行过程-结果对齐验证的基准。PRIME 从全面的大学水平 STEM 问题集合中精选,通过基于一致性的筛选流程,包含 2,530 个高难度样本。通过广泛评估,我们发现当前的验证器经常无法检测到推导缺陷。此外,我们提出了一种利用通过 PRIME 选择的验证器的过程感知可验证奖励强化学习训练范式。该方法显著优于仅基于结果的验证基线,在 AIME24、AIME25 和 Beyond-AIME 上,对于 Qwen3-14B-Base 模型,分别取得了 8.29%、9.12% 和 7.31% 的绝对性能提升。最后,我们证明了验证器在 PRIME 上的准确率与可验证奖励强化学习训练效果之间存在强线性相关性(),验证了 PRIME 作为验证器选择的可靠预测指标。
引用
@article{arxiv.2602.11570,
title = {PRIME: A Process-Outcome Alignment Benchmark for Verifiable Reasoning in Mathematics and Engineering},
author = {Xiangfeng Wang and Hangyu Guo and Yanlin Lai and Mitt Huang and Liang Zhao and Chengyuan Yao and Yinmin Zhang and Qi Han and Xiaoxiao Ren and Chun Yuan and Tong Xu and Zheng Ge and Xiangyu Zhang and Daxin Jiang},
journal= {arXiv preprint arXiv:2602.11570},
year = {2026}
}