Vibe Reasoning:挖掘前沿 AI 数学能力 —— 以 IMO 2025 Problem 6 为案例研究
人工智能
2025-12-23 v1
摘要
我们引入 Vibe Reasoning,即一种人机协作范式,用于解决复杂数学问题。我们的关键洞见是,前沿 AI 模型已经具备解决具有挑战性问题所需的知识——它们仅不知道如何、什么时候或何时应用它。Vibe Reasoning 通过通用元提示、智能体 grounding 和模型编排,将 AI 的潜在潜能转化为显现的能力。我们通过 IMO 2025 Problem 6(一个组合优化问题,其中自主 AI 系统公开报告了失败)来演示此范式。我们的解决方案将 GPT-5 的探索性能力与 Gemini 3 Pro 的证明力量结合起来,利用带 Python 代码执行和文件式记忆的智能体工作流程,推导出正确答案 (2112) 以及严密的数学证明。通过在多个尝试中进行迭代细化,我们发现智能体 grounding 和模型编排的必要性,同时人类提示从问题特定的提示演变为通用、可迁移的元提示。我们分析了高效 AI 在自主情况下为何会失败,每个组件如何解决特定的失败模式,并提炼出有效 vibe reasoning 的原则。我们的发现表明,轻量级的人类指导即可释放前沿模型的数学推理潜能。这一正在进行的工作;我们正在开发自动化框架并进行更广泛的评估,以进一步验证 Vibe Reasoning 的普适性和有效性。
引用
@article{arxiv.2512.19287,
title = {Vibe Reasoning: Eliciting Frontier AI Mathematical Capabilities -- A Case Study on IMO 2025 Problem 6},
author = {Jiaao Wu and Xian Zhang and Fan Yang and Yinpeng Dong},
journal= {arXiv preprint arXiv:2512.19287},
year = {2025}
}
备注
20 pages, 13 figures