Omni-MATH:面向大语言模型的通用奥林匹克级数学基准
计算与语言
2024-12-25 v3
摘要
近期大语言模型(LLM)的快速发展带来了显著的数学推理能力提升。然而,现有基准如GSM8K或MATH已能被高精度求解(例如,OpenAI o1在MATH数据集上达到94.8%),表明其已不足以真正考验这些模型。为弥合这一差距,我们提出了一个全面且具有挑战性的基准,旨在评估大语言模型在奥林匹克级数学推理方面的能力。与现有奥林匹克相关基准不同,我们的数据集专注于数学领域,包含4428个竞赛级问题,均经过严格的人工标注。这些问题被细致地划分为33个以上子领域,涵盖10个以上不同难度等级,实现对模型在奥林匹克数学推理方面进行全面评估。此外,我们基于本基准开展了深入分析。实验结果表明,即便是最先进的模型(如OpenAI o1-mini和o1-preview),在面对高难度奥林匹克级问题时也表现不佳,准确率分别为60.54%和52.55%,凸显了奥林匹克级数学推理中的显著挑战。
引用
@article{arxiv.2410.07985,
title = {Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models},
author = {Bofei Gao and Feifan Song and Zhe Yang and Zefan Cai and Yibo Miao and Qingxiu Dong and Lei Li and Chenghao Ma and Liang Chen and Runxin Xu and Zhengyang Tang and Benyou Wang and Daoguang Zan and Shanghaoran Quan and Ge Zhang and Lei Sha and Yichang Zhang and Xuancheng Ren and Tianyu Liu and Baobao Chang},
journal= {arXiv preprint arXiv:2410.07985},
year = {2024}
}
备注
30 pages