中文

EternalMath:演进于人类发现中的前沿数学基准

计算与语言 2026-05-08 v2

摘要

当前的大语言模型 (LLM) 数学推理评估主要依赖静态基准,或来自竞赛式问题,或通过高昂的专家努力筛选,导致覆盖范围有限且性能快速饱和。我们提出了一个完全自动化、以定理为依据的管线,用于评估前沿数学推理,直接将近期同行评审的数学文献转化为可执行且可验证的推理任务。该管线识别可构造或定量结果,将其实例化为参数化问题模板,通过执行-based 验证生成确定性解,实现可扩展、可复现且可持续更新的评估,无需依赖大规模专家编写。按此设计,该方法支持时间可扩展性、内在正确性检查以及跨数学子领域的领域特定定制。将此管线应用于实际研究论文,构建 \textbf{EternalMath},一套不断演进的评估套件。针对最新 LLM 实验揭示出显著的性能差距,表明前沿数学推理距离饱和仍有很大距离,强调需要随人类数学发现演进的评估方法。

关键词

引用

@article{arxiv.2601.01400,
  title  = {EternalMath: A Living Benchmark of Frontier Mathematics that Evolves with Human Discovery},
  author = {Jicheng Ma and Guohua Wang and Xinhua Feng and Yiming Liu and Zhichao Hu and Yuhong Liu},
  journal= {arXiv preprint arXiv:2601.01400},
  year   = {2026}
}