通过简单统一的扩展方法实现奥林匹克金牌级推理
人工智能
2026-05-14 v1 计算与语言
摘要
近期的推理模型进展大幅提升了长期程度的数学和科学问题解决能力,多个系统现已在国际数学奥林匹克(IMO)和国际物理奥林匹克(IPhO)问题上达到金牌级水平。本文引入一种简单统一的配方,将后训练的推理主干转换为严谨的奥林匹克水平求解器。该配方首先使用逆困惑课程进行监督微调(SFT),以培养严谨的证明搜索和自我检查行为,随后通过两阶段强化学习管道扩展这些行为,从RL中使用可验证奖励过渡到更精细的证明级RL,最后通过测试时扩展提升解题性能。应用该配方,我们训练了一个30B-A3B主干模型,使用约34万条次于8K token的轨迹进行SFT,随后进行200次RL步骤。得到的模型SU-01能够在解答困难问题时保持稳定推理,轨迹长度可超过10万token,同时在数学和物理奥林匹克竞赛中达到金牌级水平,包括IMO 2025、USAMO 2026和IPhO 2024/2025。它还显示出对科学推理在数学和物理之外的领域具有强大的泛化能力。
引用
@article{arxiv.2605.13301,
title = {Achieving Gold-Medal-Level Olympiad Reasoning via Simple and Unified Scaling},
author = {Yafu Li and Runzhe Zhan and Haoran Zhang and Shunkai Zhang and Yizhuo Li and Zhilin Wang and Jiacheng Chen and Futing Wang and Xuyang Hu and Yuchen Fan and Bangjie Xu and Yucheng Su and Xinmiao Han and Chenxi Li and Haodi Lei and Yufeng Zhao and Zejin Lin and Qianjia Cheng and Tong Zhu and Xiaoye Qu and Ganqu Cui and Peng Ye and Yun Luo and Zhouchen Lin and Yu Qiao and Bowen Zhou and Ning Ding and Yu Cheng},
journal= {arXiv preprint arXiv:2605.13301},
year = {2026}
}
备注
Technical Report. 77 pages