Putnam风格数据集摘要:作为数学竞赛参赛者的大型语言模型
机器学习
2026-02-03 v3 人工智能
摘要
在本文中,我们总结了Google DeepMind发布的Putnam风格基准测试的结果。该数据集包含96道具有Putnam竞赛精神的原创新题以及由LLM生成的576个解答。我们分析了模型在这组问题上的表现,以验证它们解决数学竞赛问题的能力。我们发现,顶级模型,特别是Gemini 2.5 Pro,取得了高分,展示了强大的数学推理能力,尽管它们在2024年Putnam竞赛问题上的表现较低。该分析突显了模型之间截然不同的行为模式,包括双峰得分分布以及在提供完全严格的证明方面所面临的挑战。
引用
@article{arxiv.2509.24827,
title = {Putnam-like dataset summary: LLMs as mathematical competition contestants},
author = {Bartosz Bieganowski and Daniel Strzelecki and Robert Skiba and Mateusz Topolewski},
journal= {arXiv preprint arXiv:2509.24827},
year = {2026}
}
备注
16 pages, 11 figures