中文

xVerify: 高效推理模型评估答案验证器

计算与语言 2026-01-01 v2

摘要

随着 OpenAI o1 模型的发布,采用慢速思考策略的推理模型日益增多。其输出常包含复杂推理、中间步骤和自我反思,使得现有评估方法和奖励模型难以应对。特别是,它们在判断答案等价性和可靠提取最终答案方面困难重重。为此,我们提出 xVerify,一个用于评估推理模型的高效答案验证器。xVerify 在等价性判断方面表现突出,能够准确比较不同模型输出与参考答案之间的匹配情况,适用于多样化的 question 类型。为训练和评估 xVerify,我们构建了 VAR 数据集,包含来自多个大语言模型在各种数据集上生成的 question-answer 对。该数据集融合了多种推理模型和专为推理评估设计的具挑战性的评估集合,并通过多轮标注过程确保标签质量。基于 VAR,我们在不同规模上训练了 xVerify 模型。实验结果显示,所有 xVerify 变体在测试和泛化集合上均取得 95% 以上的 F1 分数和准确率。值得注意的是,最小模型 xVerify-0.5B-I 在除 GPT-4o 之外的所有评估方法中均表现优异,而 xVerify-3B-Ib 在整体性能上超越了 GPT-4o。此外,使用 xVerify 作为奖励模型进行的强化学习实验显示,Qwen2.5-7B 相较于直接生成提升了 18.4%,显著优于使用 Math Verify 作为奖励模型所获得的提升。这些结果彰显了 xVerify 的有效性和通用性。所有 xVerify 资源均已发布于 \href{https://github.com/IAAR-Shanghai/xVerify}{GitHub}。

关键词

引用

@article{arxiv.2504.10481,
  title  = {xVerify: Efficient Answer Verifier for Reasoning Model Evaluations},
  author = {Ding Chen and Qingchen Yu and Pengyuan Wang and Mengting Hu and Wentao Zhang and Zhengren Wang and Bo Tang and Feiyu Xiong and Xinchi Li and Chao Wang and Minchuan Yang and Zhiyu Li},
  journal= {arXiv preprint arXiv:2504.10481},
  year   = {2026}
}

备注

35 pages