中文

FrontierMath:评估人工智能高级数学推理能力的基准测试

人工智能 2025-12-24 v7

摘要

我们提出了FrontierMath,一个由专家数学家创作和审查的数百个原创、极具挑战性的数学问题的基准测试。这些问题涵盖了现代数学的大多数主要分支——从数论和实分析中的计算密集型问题到代数几何和范畴论中的抽象问题。解决一个典型问题需要相关数学分支的研究者花费数小时,对于上限问题则需要数天。FrontierMath使用新的未发表问题和自动验证来可靠地评估模型,同时最小化数据污染的风险。当前最先进的AI模型解决的问题不到2%,揭示了AI能力与数学界实力之间的巨大差距。随着AI系统向专家级数学能力发展,FrontierMath提供了一个严格的测试平台来量化其进展。

关键词

引用

@article{arxiv.2411.04872,
  title  = {FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI},
  author = {Elliot Glazer and Ege Erdil and Tamay Besiroglu and Diego Chicharro and Evan Chen and Alex Gunning and Caroline Falkman Olsson and Jean-Stanislas Denain and Anson Ho and Emily de Oliveira Santos and Olli Järviniemi and Matthew Barnett and Robert Sandler and Matej Vrzala and Jaime Sevilla and Qiuyu Ren and Elizabeth Pratt and Lionel Levine and Grant Barkley and Natalie Stewart and Bogdan Grechuk and Tetiana Grechuk and Shreepranav Varma Enugandla and Mark Wildon},
  journal= {arXiv preprint arXiv:2411.04872},
  year   = {2025}
}