Heimdall:基于生成式验证的测试时放大
人工智能
2025-04-17 v2
摘要
AI系统只能在其自身知识得到验证的前提下才能创建和维持知识。近期关于长链思维推理的工作表明,大语言模型在解决竞争性问题方面具有巨大潜力,但其验证能力仍显得薄弱且不够受到充分调查。本文提出Heimdall,即一种长CoT验证LLM,可准确判断解答的正确性。通过纯强化学习,我们将验证准确率从62.5%提升至94.5%(针对竞争性数学问题),通过重复抽样放大,准确率进一步提高到97.5%。通过人类评估,Heimdall展示出惊人的泛化能力,成功检测到大多数在训练期间未包含的具有挑战性数学证明中的问题。此外,我们提出悲观验证(Pessimistic Verification),以扩展Heimdall的功能,用于放大问题解决。它调用Heimdall来判断来自求解模型的解答,并基于悲观原则,选择最可能正确且不确定性最低的解答。以DeepSeek-R1-Distill-Qwen-32B为求解模型,悲观验证将AIME2025上的解答准确率从54.2%提高至70.0%(采用16倍计算预算),并在更多计算预算下提升至83.3%。以更强大的solver模型Gemini 2.5 Pro为求解器,得分达到93.0%。最后,我们原型化了一个自动知识发现系统——一个三元系统,其中一个提出问题,另一个提供解答,第三个验证解答。使用数据合成工作NuminaMath完成前两个组件,Heimdall有效识别数据集中存在的问题性记录,揭示了近半数的该数据存在缺陷,这与NuminaMath的最近消融研究结果相符。
引用
@article{arxiv.2504.10337,
title = {Heimdall: test-time scaling on the generative verification},
author = {Wenlei Shi and Xing Jin},
journal= {arXiv preprint arXiv:2504.10337},
year = {2025}
}