中文

MathArena:在无污染数学竞赛上评估大语言模型

人工智能 2026-01-16 v3 计算与语言

摘要

大语言模型(LLM)推理能力的快速提升使其在数学基准测试上取得了显著进步。然而,许多最常用的评估数据集(例如 AIME 2024)在网上广泛可见,这使得难以将真正的推理与潜在的记忆区分开来。此外,这些基准测试并未评估证明书写能力,而这对于许多数学任务至关重要。为了解决这一问题,我们引入了 MathArena,一个基于以下关键见解的新基准测试:定期举办的数学竞赛提供了一系列高质量、具有挑战性的问题,可用于对 LLM 进行实时评估。通过在新问题发布后立即评估模型,我们有效消除了数据污染的风险。使用此框架,我们发现了 AIME 2024 存在严重污染迹象。尽管如此,在更难的竞赛(如 CMIMC 2025)上的评估表明,表现最佳的模型展示出了令人印象深刻的推理能力。MathArena 也是首个评估证明书写能力的基准测试。在 IMO 2025 上,顶级模型的成绩略低于 40%,这既表明了显著的进步,也说明仍有巨大的改进空间。到目前为止,我们已在七场竞赛中评估了超过 5050 个模型,共计 162162 道题目。作为一个不断发展的基准测试,MathArena 将继续跟踪 LLM 在最新发布竞赛上的进展,确保对数学推理进行严格且最新的评估。

关键词

引用

@article{arxiv.2505.23281,
  title  = {MathArena: Evaluating LLMs on Uncontaminated Math Competitions},
  author = {Mislav Balunović and Jasper Dekoninck and Ivo Petrov and Nikola Jovanović and Martin Vechev},
  journal= {arXiv preprint arXiv:2505.23281},
  year   = {2026}
}