超越基准测试:MathArena 作为 LLM 数学评估平台
计算与语言
2026-05-18 v2
摘要
大型语言模型 (LLM) 正变得越来越高效的数学合作伙伴,但静态基准测试已不再足够评估进展:它们在范围上往往有限、容易饱和、很少更新。这使得可靠比较模型并跟踪时间序列进展变得困难。相反,我们需要评估平台:持续维护的系统,运行、聚合和分析跨多个基准测试的评估,以提供模型在广泛领域内性能的全面图景。本文构建于原始 MathArena 基准之上,通过大幅扩展其范围,从最终答案奥林匹克问题,扩展到用于数学推理的持续维护评估平台。MathArena 现已涵盖更广泛的任务,包括证明类竞赛、研究水平的 arXiv 题目,以及 Lean 中的形式化证明生成。此外,我们维护明确的模型评估协议,并定期设计新的基准测试以适应模型能力的提升,以确保 MathArena 持续具有挑战性。值得注意的是,最强大的模型 GPT-5.5 在 2026 年美国数学奥林匹克竞赛中取得 98% 的得分,在研究水平问题上取得 74% 的得分,表明前沿模型现在能够轻松解决极具挑战性的数学问题。这凸显了持续维护评估平台如 MathArena 在跟踪 LLM 在数学推理方面快速进展方面的重要性。
引用
@article{arxiv.2605.00674,
title = {Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs},
author = {Jasper Dekoninck and Nikola Jovanović and Tim Gehrunger and Kári Rögnvaldsson and Ivo Petrov and Chenhao Sun and Martin Vechev},
journal= {arXiv preprint arXiv:2605.00674},
year = {2026}
}