中文

Putnam风格数据集摘要:作为数学竞赛参赛者的大型语言模型

机器学习 2026-02-03 v3 人工智能

摘要

在本文中,我们总结了Google DeepMind发布的Putnam风格基准测试的结果。该数据集包含96道具有Putnam竞赛精神的原创新题以及由LLM生成的576个解答。我们分析了模型在这组问题上的表现,以验证它们解决数学竞赛问题的能力。我们发现,顶级模型,特别是Gemini 2.5 Pro,取得了高分,展示了强大的数学推理能力,尽管它们在2024年Putnam竞赛问题上的表现较低。该分析突显了模型之间截然不同的行为模式,包括双峰得分分布以及在提供完全严格的证明方面所面临的挑战。

关键词

引用

@article{arxiv.2509.24827,
  title  = {Putnam-like dataset summary: LLMs as mathematical competition contestants},
  author = {Bartosz Bieganowski and Daniel Strzelecki and Robert Skiba and Mateusz Topolewski},
  journal= {arXiv preprint arXiv:2509.24827},
  year   = {2026}
}

备注

16 pages, 11 figures