中文

Putnam-AXIOM:一个用于衡量大语言模型高阶数学推理的功能性与静态基准

计算与语言 2025-08-28 v2 人工智能 机器学习 计算机科学中的逻辑 神经与进化计算

摘要

当前用于大语言模型(LLMs)的数学推理基准正趋于饱和,部分模型准确率超过 90%,并且日益受到训练集污染的影响。我们引入了 Putnam-AXIOM,一个包含 522 道大学水平竞赛题的基准,题目源自久负盛名的威廉·洛厄尔·普特南数学竞赛,以及 Putnam-AXIOM Variation,一个由 100 个通过程序化扰动变量和常数生成的未见过的功能性变体组成的配套集。该变体生成协议可产生无限量的同等难度、未见过的实例——从而形成一个抗污染的测试平台。在原始数据集上,OpenAI 的 o1-preview——表现最强的评估模型——得分为 41.9%,但其在配对的变体集上的准确率下降了 19.6%(相对下降 46.8%)。其余 18 个模型也显示出相同的下降趋势,其中 10 个模型的 95% 置信区间不重叠。这些差距暗示了记忆现象,并凸显了动态基准的必要性。我们用教师强制准确率(TFA)来补充“框内”准确率,TFA 是一种轻量级指标,可直接对推理轨迹进行评分并自动化自然语言证明评估。因此,Putnam-AXIOM 提供了一个严谨、抗污染的评估框架,用于评估大语言模型的高级数学推理能力。数据和评估代码可在 https://github.com/brando90/putnam-axiom 公开获取。

关键词

引用

@article{arxiv.2508.08292,
  title  = {Putnam-AXIOM: A Functional and Static Benchmark for Measuring Higher Level Mathematical Reasoning in LLMs},
  author = {Aryan Gulati and Brando Miranda and Eric Chen and Emily Xia and Kai Fronsdal and Bruno Dumont and Elyas Obbad and Sanmi Koyejo},
  journal= {arXiv preprint arXiv:2508.08292},
  year   = {2025}
}

备注

27 pages total (10-page main paper + 17-page appendix), 12 figures, 6 tables. Submitted to ICML 2025 (under review)