哥德尔测试:大型语言模型能否解决简单的猜想?
人工智能
2025-09-24 v1 离散数学
机器学习
摘要
前沿 AI 模型实验室的最新公告强调了他们在高中和大学数学竞赛中的强劲表现。然而,目前尚不清楚大型语言模型能否在更高级的数学领域中解决新的、简单的猜想。我们提出哥德尔测试:评估模型能否为非常简单的、此前未解决的猜想生成正确的证明。为此,我们研究了 GPT-5 在五个组合优化猜想上的表现。对于每个问题,我们提供了一到两篇该猜想所源自的源论文,隐藏了我们自己的猜想,然后详细评估模型的推理过程。在三个较简单的问题上,GPT-5 产生了近乎正确的解;对于问题 2,它甚至推导出一个不同的近似下界,经检验该下界反驳了我们的猜想,同时提供了一个有效解。模型在问题 4 上失败,该问题需要综合两篇论文的结果。在问题 5 上——一个没有已验证猜想的更难案例——GPT-5 提出了与我们设想相同的算法,但在分析中失败,表明该证明比预期更具挑战性。尽管样本量有限,但结果表明在常规推理上有实质性进展,偶尔展现出原创性火花,而在跨论文综合时存在明显局限。GPT-5 可能代表前沿模型最终通过哥德尔测试的早期步骤。
引用
@article{arxiv.2509.18383,
title = {G\"odel Test: Can Large Language Models Solve Easy Conjectures?},
author = {Moran Feldman and Amin Karbasi},
journal= {arXiv preprint arXiv:2509.18383},
year = {2025}
}