Proof2Hybrid:面向证明中心问题的自动数学基准合成
计算与语言
2025-08-06 v2 人工智能
摘要
评估大型语言模型的数学能力是一个关键但具有挑战性的前沿领域。现有基准存在不足,特别是对于以证明为中心的问题,因为人工创建不可扩展且成本高昂,导致大型语言模型真正的数学能力在很大程度上未被评估。为了克服这些障碍,我们提出了Proof2Hybrid,这是第一个完全自动化的框架,能够从自然语言数学语料库中合成高质量、以证明为中心的基准。我们解决方案的关键创新是Proof2X,一个将数学证明转化为各种易于验证的问题的路线图。在此路线图的指导下,我们提出了一种新型的混合格式问题,命名为“-out-of-多重判断问题”,专门设计用于实现鲁棒的自动评估,同时能够抵御传统格式中固有的猜测和浅层模式匹配。作为我们框架的演示,我们引入了AlgGeoTest,一个针对代数几何(现代数学的前沿领域)的基准,包含456个具有挑战性的项目。我们使用AlgGeoTest对最先进的大型语言模型进行的广泛评估揭示了它们在理解代数几何方面的深刻缺陷,从而更精确地衡量了它们真正的数学能力。我们的框架和基准为深入研究AI系统的数学智能的新一波浪潮铺平了道路。
引用
@article{arxiv.2508.02208,
title = {Proof2Hybrid: Automatic Mathematical Benchmark Synthesis for Proof-Centric Problems},
author = {Yebo Peng and Zixiang Liu and Yaoming Li and Zhizhuo Yang and Xinye Xu and Bowen Ye and Weijun Yuan and Zihan Wang and Tong Yang},
journal= {arXiv preprint arXiv:2508.02208},
year = {2025}
}