基于RL训练的准确诚实测试时扩展验证
机器学习
2025-09-30 v1
摘要
通过解题采样和聚合来实现测试时扩展已成为提高大型语言模型(LLM)推理性能的关键范式。虽然通常会采用奖励模型选择,但该方法往往难以识别少数且正确的答案,限制了其在简单多数投票之外的有效性。我们认为,这一限制源于在验证器训练期间缺乏信息丰富的批评信号。为弥合这一差距,我们引入了Mirror-Critique,一个训练具有信息丰富批评信号的验证器框架。我们的关键洞察是通过对比模型生成的解题方案与真实解题方案,利用丰富的批评信号。我们部署小型指令调优模型,通过拒绝抽样合成高质量的批评数据,教导验证器不仅了解错误所在,还了解其原因。所生成的Mirror-Verifier用于评估候选解题方案,通过生成多个批评并聚合为验证分数来实现加权投票或选择性放弃。实验结果表明,Mirror-Verifier在解题准确性方面显著优于多数投票,也提高了求解器对自身能力边界内外的诚实程度。
引用
@article{arxiv.2509.23152,
title = {Critique to Verify: Accurate and Honest Test-Time Scaling with RL-Trained Verifiers},
author = {Zhicheng Yang and Zhijiang Guo and Yinya Huang and Yongxin Wang and Yiwei Wang and Xiaodan Liang and Jing Tang},
journal= {arXiv preprint arXiv:2509.23152},
year = {2025}
}
备注
15 pages, 7 figures