ProcessBench:识别数学推理中的过程错误
人工智能
2025-05-27 v4 计算与语言
机器学习
摘要
由于语言模型在解决数学问题时经常出错,自动识别推理过程中的错误对于其可扩展的监督变得越来越重要。在本文中,我们引入 ProcessBench 用于衡量识别数学推理中错误步骤的能力。它包含 3,400 个测试用例,主要聚焦于竞赛和奥林匹克级别的数学问题。每个测试用例包含一个逐步求解过程,其中错误位置由人工专家标注。模型需要识别包含错误的最早步骤,或得出所有步骤均正确的结论。我们对 ProcessBench 进行了广泛评估,涉及两种类型的模型:过程奖励模型(PRMs)和评判模型,其中对于后者我们提示通用语言模型逐步评判每个求解步骤。我们得出两个主要观察:(1)现有的 PRM 通常无法泛化到 GSM8K 和 MATH 之外更具挑战性的数学问题。它们的表现不如评判模型(即提示的通用语言模型)和我们自身通过在 PRM800K 数据集上简单微调训练的 PRM。(2)最佳开源模型 QwQ-32B-Preview 已展现出与专有模型 GPT-4o 相当的评判能力,尽管它仍落后于专门针对推理的 o1-mini。我们希望 ProcessBench 能够促进推理过程评估方面的未来研究,为语言模型的可扩展监督铺平道路。
引用
@article{arxiv.2412.06559,
title = {ProcessBench: Identifying Process Errors in Mathematical Reasoning},
author = {Chujie Zheng and Zhenru Zhang and Beichen Zhang and Runji Lin and Keming Lu and Bowen Yu and Dayiheng Liu and Jingren Zhou and Junyang Lin},
journal= {arXiv preprint arXiv:2412.06559},
year = {2025}
}
备注
ACL 2025