轻量级自动化 AI 流水线能否解决研究级数学难题?
人工智能
2026-03-10 v2 交换代数
组合数学
范畴论
摘要
大语言模型(LLMs)最近在生成严谨的数学证明方面取得了显著成功,“AI 数学”已成为一个充满活力的研究领域(Ju 等人,2026)。虽然这些模型已经掌握了国际数学奥林匹克(Huang 等人,2025;Duan 等人,2025)等竞赛级基准测试,并通过自动形式化(Wang 等人,2025)在研究应用中展现出潜力,但通过轻量级自然语言流水线将其部署用于研究问题仍处于探索不足的阶段。在这项工作中,我们展示了新一代模型(例如 Gemini 3 Pro、GPT-5.2 Pro)在集成到针对基于引文的验证进行优化的精简自动化流水线中时,能够解决复杂的研究级问题。我们在两个新颖的数据集上评估了我们的流水线:(1)由顶尖数学家提出的 ICCM(2025)问题集(难度与丘成桐大学生数学竞赛相当)(上海数学挑战赛,2026),以及(2)“First Proof”问题集(Abouzaid 等人,2026),该问题集包含此前未发表的研究问题。我们的流水线为前两个 ICCM 问题集和“First Proof”问题集中的所有问题生成了候选证明。前两个 ICCM 问题集和“First Proof”问题集第 4 题的解答已由我们团队完全验证。所有生成的证明均已提交给官方组织,我们生成的结果可在 https://github.com/ml1301215/question_sets-test_results 上公开获取。我们已将代码开源,并为该工作流开发了一个用户友好的界面,可通过 https://github.com/ml1301215/research-math-assistant 访问。
引用
@article{arxiv.2602.13695,
title = {Can a Lightweight Automated AI Pipeline Solve Research-Level Mathematical Problems?},
author = {Lve Meng and Weilong Zhao and Yanzhi Zhang and Haoxiang Guan and Jiyan He},
journal= {arXiv preprint arXiv:2602.13695},
year = {2026}
}
备注
9 pages