HorizonMath:基于自动验证测量AI向数学发现进程的进展
机器学习
2026-03-17 v1
摘要
AI能否在重要且未解数学问题上取得进展?大语言模型已具备相当程度的数学和科学推理能力,但它们能否进行新颖的研究仍被广泛争议且缺乏探索。我们提出HorizonMath,一个包含100多个主要未解问题的基准,覆盖计算和应用数学的8个领域,并配备开源评估框架进行自动验证。我们的基准针对一类发现难以实现、需要深刻数学洞察但验证计算高效简单的问题。由于这些解决方案未知,HorizonMath免受数据污染影响,大多数最先进模型得分接近0%。现有研究水平基准依赖形式化证明验证或人工审查,两者都难以规模化。通过该平台,我们发现两个问题中,GPT 5.4 Pro提出的解决方案超越了已知最佳 published结果,可能代表新颖贡献(待专家审查)。我们将HorizonMath发布为开放性挑战和不断增长的社区资源,其中来自未解问题类的正确解决方案可能构成数学文献中的新颖结果。
引用
@article{arxiv.2603.15617,
title = {HorizonMath: Measuring AI Progress Toward Mathematical Discovery with Automatic Verification},
author = {Erik Y. Wang and Sumeet Motwani and James V. Roggeveen and Eliot Hodges and Dulhan Jayalath and Charles London and Kalyan Ramakrishnan and Flaviu Cipcigan and Philip Torr and Alessandro Abate},
journal= {arXiv preprint arXiv:2603.15617},
year = {2026}
}