SKYLENAGE技术报告:多层次数学评估的数学推理与竞赛创新基准
计算与语言
2025-10-03 v1
摘要
大语言模型(LLM)现在在许多公共数学测试集上表现强劲,但数学领域内的前沿分离日益受到天花板效应的困扰。我们提出了两个互补的基准:SKYLENAGE-ReasoningMATH,一套100题的结构感知诊断集,每道题均带有关于长度、数值密度和符号复杂度的元数据;以及SKYLENAGE-MATH,一套150题的竞赛风格题集,涵盖从高中到博士的四个阶段,设有七个科目分类。我们在统一设置下评估了十五种当代LLM变体,并分析科目×模型和年级×模型的性能。在竞赛题集上,最强模型达到44%,亚军达到37%;准确率从高中到博士逐步下降,且顶尖系统在博士到高中的保持率接近79%。在推理题集上,最佳模型总体达到81%,最难切片的结果揭示了领先者与中等水平之间的明显鲁棒性差距。总之,我们发布了SKYLENAGE-ReasoningMATH并报告了SKYLENAGE-MATH的汇总结果;SKYLENAGE共同提供了一个难度高、以推理为中心且覆盖广泛的数学基准,具有校准的难度和丰富的元数据,可作为未来数学推理评估的参考基准。
引用
@article{arxiv.2510.01241,
title = {SKYLENAGE Technical Report: Mathematical Reasoning and Contest-Innovation Benchmarks for Multi-Level Math Evaluation},
author = {Hu Wei and Ze Xu and Boyu Yang and Linlin Miao and Weiqi Zhai and Yihan Li and Zixuan Li and Zhijun Wang and Boya Wang and Jianwei Yu and Jialing Yuan and Xiaoyue Zhang and Cheng He and Minglei Chen and Zifan Zhang and Qianhui Li and Wei Wang and Xiang Xu},
journal= {arXiv preprint arXiv:2510.01241},
year = {2025}
}