EEFSUVA:一个全新的数学奥林匹克基准测试
计算与语言
2025-10-06 v1 机器学习
历史与综述
摘要
近期的突破引发了声称大语言模型(LLMs)在数学基准测试上达到金牌奥林匹克选手至研究生水平的熟练程度的呼声。在这项工作中,我们详细审视了这些主张,并评估当前基准测试在多大程度上捕捉到了真正的大语言模型数学推理能力。这些基准测试的组成主要源自国际数学奥林匹克(IMO)和相关竞赛,可能由于潜在的数据污染和对熟悉问题类型的狭窄关注而高估了模型的推理能力。为了实现对数学理解的更全面评估,我们引入了EEFSUVA,一个来自东欧和前苏联国家地区性和国家性奥林匹克竞赛的新基准测试,这些竞赛的问题难度与IMO相当,并以要求非标准解题方法而闻名,但其问题在线语料库中远为少见。初步结果表明,即使是最先进的大语言模型在EEFSUVA上的表现也明显低于其他奥林匹克风格基准测试。这些发现还表明更广泛的评估数据集对于更全面地评估数学推理和指导未来模型开发的潜在重要性。
引用
@article{arxiv.2510.01227,
title = {EEFSUVA: A New Mathematical Olympiad Benchmark},
author = {Nicole N Khatibi and Daniil A. Radamovich and Michael P. Brenner},
journal= {arXiv preprint arXiv:2510.01227},
year = {2025}
}
备注
16 Pages, 5 figures