CoSineVerifier:用于计算导向科学问题的工具增强答案验证
机器学习
2025-12-02 v1
摘要
答案验证方法在语言模型训练管道中广泛应用,涵盖数据 curated、评估和可验证奖励(RLVR)。虽然先前工作专注于开发适用于多种推理场景的统一验证器,但在计算导向的科学领域(如代数等价性检查和物理常数替换)仍面临诸多挑战。本文引入\model,一种利用外部执行器进行精确计算和符号化简的工具增强验证器。\model 实现超越简单语义匹配的稳健验证。我们提出了一种新颖的两阶段管道,先进行冷启动微调,然后结合工具集成进行多轮强化学习。在STEM学科、通用QA和长篇推理任务上的广泛实验表明,\model 在一般化方面表现强劲。结果显示,\model 在VerifyBench-Hard和SCI-Bench 上实现了最先进的性能。我们还在RLVR中采用我们的\model 作为奖励模型,结果显示它在AIME'24和AIME'25 上 consistently 优于基于 rubric 的验证器和基于模型的验证器,显示出强大的潜力来增强LLM的推理能力。我们的模型已发布于\hyperlink{https://huggingface.co/Nanbeige/CoSineVerifier-Tool-4B}{https://huggingface.co/Nanbeige/CoSineVerifier-Tool-4B}。
引用
@article{arxiv.2512.01224,
title = {CoSineVerifier: Tool-Augmented Answer Verification for Computation-Oriented Scientific Questions},
author = {Ruixiang Feng and Zhenwei An and Yuntao Wen and Ran Le and Yiming Jia and Chen Yang and Zongchao Chen and Lisi Chen and Shen Gao and Shuo Shang and Yang Song and Tao Zhang},
journal= {arXiv preprint arXiv:2512.01224},
year = {2025}
}