奥林匹克级数学问题解答的长程推理智能体
计算与语言
2025-12-15 v2 人工智能
摘要
大规模推理模型(LRM)通过链式思考(CoT)技术和可验证奖励强化学习(RLVR)扩展了数学推理的前沿,能够解答AIME水平的问题。然而,LRM的性能严重依赖于扩展的推理上下文长度。对于解答国际数学奥林匹克(IMO)等超难问题而言,所需的推理复杂度超出了LRM在单轮中能探索的空间。以往工作尝试扩展LRM的推理上下文,但基于专有模型,缺乏系统的结构和训练管线。因此,本文引入Intern-S1-MO,一个进行多轮分层推理的长程数学智能体,包含基于LRM的多智能体系统,包括推理、总结与验证模块。通过维持以定语形式存储的紧凑记忆,Intern-S1-MO能够在多个推理阶段自由探索丰富的定语空间,从而突破IMO级数学问题的上下文限制。此外,我们提出OREAL-H,用于训练LRM的在线RL框架,能够同步引导LRM的推理能力并提升Intern-S1-MO的整体性能。实验表明,Intern-S1-MO在IMO2025非几何问题中获得26分,匹配银牌获得者水平;在HMMT2025、AIME2025、CNMO2025等推理基准测试中超越当前先进LRM。此外,我们的智能体在CML2025中获102/126分,经人类专家鉴定达到金牌水平。
引用
@article{arxiv.2512.10739,
title = {Long-horizon Reasoning Agent for Olympiad-Level Mathematical Problem Solving},
author = {Songyang Gao and Yuzhe Gu and Zijian Wu and Lingkai Kong and Wenwei Zhang and Zhongrui Cai and Fan Zheng and Tianyou Ma and Junhao Shen and Haiteng Zhao and Duanyang Zhang and Huilun Zhang and Kuikun Liu and Chengqi Lyu and Yanhui Duan and Chiyu Chen and Ningsheng Ma and Jianfei Gao and Han Lyu and Dahua Lin and Kai Chen},
journal= {arXiv preprint arXiv:2512.10739},
year = {2025}
}