中文

FormulaOne:衡量超越竞赛编程的算法推理深度

人工智能 2025-07-18 v1 计算复杂性 逻辑

摘要

前沿AI模型展现出惊人的知识广度。但它们离真正的人类——或超人类——专业知识还有多远?真正的专家能够解决最困难的问题并推动科学理解的边界。为了揭示前沿模型能力的极限,我们不再关注人为设计的竞赛编程难题,而是聚焦于现实生活中的研究问题。我们构建了FormulaOne,一个位于图论、逻辑和算法交叉点的基准测试,所有这些都完全在前沿模型的训练分布之内。我们的问题极具挑战性,需要一系列推理步骤。该数据集具有三个关键特性。首先,它具有商业价值,并与实际的大规模优化问题相关,例如路由、调度和网络设计中产生的问题。其次,它基于高度表达性的图上的单子二阶(MSO)逻辑框架生成,为大规模自动生成问题铺平了道路;非常适合构建强化学习环境。第三,我们的许多问题与理论计算机科学的前沿及其核心猜想(如强指数时间假说(SETH))密切相关。因此,任何在我们的数据集上超越已知结果的重大算法进展都可能具有深远的理论意义。值得注意的是,像OpenAI的o3这样的最先进模型在FormulaOne上完全失败,即使给予10次尝试和解释性的少样本示例,也只能解决不到1%的问题——这突显了它们在某些领域距离专家级理解还有多远。为了支持进一步的研究,我们还整理了FormulaOne-Warmup,提供了一组来自同一分布的更简单任务。我们发布了完整的语料库以及一个全面的评估框架。

关键词

引用

@article{arxiv.2507.13337,
  title  = {FormulaOne: Measuring the Depth of Algorithmic Reasoning Beyond Competitive Programming},
  author = {Gal Beniamini and Yuval Dor and Alon Vinnikov and Shir Granot Peled and Or Weinstein and Or Sharir and Noam Wies and Tomer Nussbaum and Ido Ben Shaul and Tomer Zekharya and Yoav Levine and Shai Shalev-Shwartz and Amnon Shashua},
  journal= {arXiv preprint arXiv:2507.13337},
  year   = {2025}
}