通过模型无关的验证-精炼管线在 IMO 2025 中夺得金牌
人工智能
2025-10-01 v4
摘要
国际数学竞赛(IMO)广为人知,是高中生数学的世界锦标赛。IMO 题目以其难度和新颖性著称,要求选手具备深刻的洞察力、创造力和严谨性。尽管大型语言模型在许多数学基准测试中表现良好,但常在奥林匹克级别的问题上感到挑战。我们通过精心设计的提示词构建了一个模型无关的验证-精炼管线。我们在最近的 IMO 2025 上展示了其有效性,避免了在比赛前发布的模型的数据污染。搭载三大领先模型中的任意一种——Gemini 2.5 Pro、Grok-4 或 GPT-5——我们的管线成功解决了 6 道题目中的 5 道(约 85.7% 的准确率)。这与它们的基线准确率形成鲜明对比:31.6%(Gemini 2.5 Pro)、21.4%(Grok-4)和 38.1%(GPT-5),后者通过从 32 个候选解中挑选最佳解获得。显著的改进强调,针对复杂任务充分发挥 AI 推理潜力的路径,不仅需要开发更强大的基础模型,还需要设计有效的方法来实现这一目标。
引用
@article{arxiv.2507.15855,
title = {Winning Gold at IMO 2025 with a Model-Agnostic Verification-and-Refinement Pipeline},
author = {Yichen Huang and Lin F. Yang},
journal= {arXiv preprint arXiv:2507.15855},
year = {2025}
}