开放性数学问题的悲观验证
人工智能
2025-11-27 v1
摘要
验证性能的关键限制在于错误检测能力。基于此,我们设计了几种悲观验证变体,这些是能够显著提高开放性数学问题验证的简单工作流程。在悲观验证中,我们为同一证明构建多个并行验证,如果其中任何一个报告错误,则认为该证明是不正确的。这一简单技术在许多数学验证基准测试中均显著提升了性能,而且计算资源消耗并不显著。其token效率甚至在测试时扩展中超过了扩展的长程CoT。我们的案例研究进一步表明,更强模型中大多数假阴性实际上是由原始数据集中的注释错误导致的,因此我们的方法的实际表现被低估了。数学问题的自我验证可以有效提高语言模型输出的可靠性和性能,也在实现长程数学任务中发挥关键作用。我们相信,悲观验证的研究将有助于提升语言模型在广泛任务中的数学能力。
引用
@article{arxiv.2511.21522,
title = {Pessimistic Verification for Open Ended Math Questions},
author = {Yanxing Huang and Zihan Tang and Zejin Lin and Peng Li and Yang Liu},
journal= {arXiv preprint arXiv:2511.21522},
year = {2025}
}