Riemann-Bench:一个月球级数学基准
人工智能
2026-04-09 v1
摘要
最近的AI系统在国际数学奥林匹克金 medal 级别的表现,展示了在竞技式问题解决方面的显著专业能力。然而,竞技数学仅代表数学推理的狭窄切片:问题来自有限的领域,需要很少的高级工具,往往可以奖励洞察性技巧而非深层理论知识。我们引入\bench{},一个由25个专家精选问题构成的私人基准,旨在评估AI系统在远超奥林匹克前沿的研究级数学推理能力。问题由常春藤大学数学教授、研究生及拥有奥林匹克金 medal的博士撰写,这些问题通常需要作者数周独立求解。每个问题都经过两个独立领域专家的双盲验证,必须从头解决,并产生唯一的闭式解经程序化验证器评估。我们将前沿模型评估为无约束的研究代理,充分访问编码工具、搜索和开放式推理,使用在100个独立运行中计算的无偏统计估计器。我们的结果显示,所有前沿模型得分不足10%,暴露了奥林匹克水平问题解决与真正研究级数学推理之间的 substantial 鸿沟。通过保持基准完全私有,我们确保测量的性能反映真实的数学能力而非训练数据的记忆。
引用
@article{arxiv.2604.06802,
title = {Riemann-Bench: A Benchmark for Moonshot Mathematics},
author = {Suhaas Garre and Erik Knutsen and Sushant Mehta and Edwin Chen},
journal= {arXiv preprint arXiv:2604.06802},
year = {2026}
}