DeepMath-Creative:用于评估大型语言模型数学创造力的基准
人工智能
2025-05-14 v1
摘要
为推进大型语言模型 (LLM)的数学水平,DeepMath 团队已启动一个开源计划,旨在开发开源数学 LLM 并系统评估其数学创造力。这篇论文代表了该计划的初始贡献。尽管最近在数学 LLM 方面的发展主要侧重于推理技能,如由基础到大学本科水平的数学任务基准所显示,但这些模型的创造能力得到了相对较少的关注,评估数据集也相对稀缺。为填补这一差距,我们提出了数学创造力的评估标准,引入 DeepMath-Creative,一个包含代数、几何、分析等多个领域构造问题的新型高质量基准。我们使用该数据集对主流 LLM 的创造性问题解决能力进行系统评估。实验结果表明,即使在宽松的评分标准下——即强调核心解题要素,忽略小逻辑漏洞、论证不完整或冗余解释等——最佳表现模型 O3 Mini 仅达到70%的准确率,主要集中在基础大学本科水平的构造任务上。对于更复杂的问题,模型表现迅速下降,模型无法提供针对开放性问题的实质性策略。这些发现表明,尽管当前 LLM 在熟悉且较低难度的问题上显示出一定程度的构造能力,但这种表现可能归因于对已记忆模式的重新组合,而非真正的创造性洞察或新颖的综合。
引用
@article{arxiv.2505.08744,
title = {DeepMath-Creative: A Benchmark for Evaluating Mathematical Creativity of Large Language Models},
author = {Xiaoyang Chen and Xinan Dai and Yu Du and Qian Feng and Naixu Guo and Tingshuo Gu and Yuting Gao and Yingyi Gao and Xudong Han and Xiang Jiang and Yilin Jin and Hongyi Lin and Shisheng Lin and Xiangnan Li and Yuante Li and Yixing Li and Zhentao Lai and Zilu Ma and Yingrong Peng and Jiacheng Qian and Hao-Yu Sun and Jianbo Sun and Zirui Wang and Siwei Wu and Zian Wang and Bin Xu and Jianghao Xu and Yiyang Yu and Zichuan Yang and Hongji Zha and Ruichong Zhang},
journal= {arXiv preprint arXiv:2505.08744},
year = {2025}
}
备注
14 pages, 4 figures