中文

面向高效长链思维验证的基于结果的过程验证器 OPV

计算与语言 2025-12-12 v1 机器学习

摘要

大型语言模型 (LLM) 通过与可验证奖励的强化学习 (RLVR) 取得了在解决复杂推理任务方面取得显著进展. 这一进展离不开可靠验证器对监督的支持. 然而, 当前的结果基于验证器 (OV) 无法检查长链思维 (CoT) 中不可靠中间步骤;而当前基于过程的验证器 (PV) 则因人工标注成本高昂导致高质量标注稀缺, 在可靠检测复杂长 CoT 中的错误方面存在困难. 因此, 我们提出了结果-过程验证器 (OPV), 通过验证从长 CoT 中总结的预期结果的论证过程来实现准确且高效的验证, 并实现大规模标注. 为了赋予所提出的验证器能力, 我们采用具有专家标注的迭代主动学习框架, 以更少的标注成本逐步提高 OPV 的验证能力. 具体而言, 在每一轮中, 对当前最佳 OPV 最不确定的案例进行标注, 然后通过重新精调 (RFT) 和 RLVR 训练新的 OPV 以供下一轮使用. 大量实验表明, OPV 在性能和适用性方面均表现出优势. 它在我们保留的 OPV-Bench 上取得新的最高结果, 以 83.1 的 F1 分数击败更大的开源模型如 Qwen3-Max-Preview, 其得分为 76.3. 此外, OPV 能有效检测合成数据集中的误报, 并与专家评估高度一致. 在与政策模型合作时, OPV 持续带来性能提升, 例如在 AIME2025 上将 DeepSeek-R1-Distill-Qwen-32B 的准确率从 55.2% 提升至 73.3% (随计算预算的增加).

关键词

引用

@article{arxiv.2512.10756,
  title  = {OPV: Outcome-based Process Verifier for Efficient Long Chain-of-Thought Verification},
  author = {Zijian Wu and Lingkai Kong and Wenwei Zhang and Songyang Gao and Yuzhe Gu and Zhongrui Cai and Tianyou Ma and Yuhong Liu and Zhi Wang and Runyuan Ma and Guangyu Wang and Wei Li and Conghui He and Dahua Lin and Kai Chen},
  journal= {arXiv preprint arXiv:2512.10756},
  year   = {2025}
}