中文

通过复杂度提升强化学习实现奥林匹克水平几何大语言模型智能体

人工智能 2026-03-06 v3

摘要

大型语言模型(LLM)智能体表现出强大的数学问题解决能力,甚至能够在形式证明系统的辅助下解决国际数学奥林匹克(IMO)水平问题。然而,由于对辅助构造的启发式方法较弱,几何问题的AI仍然主要由专家模型主导,如AlphaGeometry 2,这些模型在训练和评估中高度依赖大规模数据合成和搜索。本文首次尝试构建一款获得奖牌水平LLM智能体用于几何问题,称为InternGeometry。InternGeometry通过迭代提出命题和辅助构造,利用符号引擎进行验证,并根据引擎反馈反思以引导后续提议。动态记忆机制使InternGeometry能够在每个问题上进行200多次与符号引擎的交互。为进一步加速学习,我们引入复杂度提升强化学习(CBRL),在训练阶段逐渐增加合成问题的复杂度。基于InternThinker-32B,InternGeometry仅使用13K训练样本(仅为AlphaGeometry 2使用的数据的0.004%),即解决了44个50个IMO几何问题(2000-2024年),超越了平均金牌得分(40.9),展示了LLM智能体在专家水平几何任务方面的潜力。InternGeometry还能为IMO问题提出 novel的辅助构造,这些构造在人类解答中并不存在。

关键词

引用

@article{arxiv.2512.10534,
  title  = {Achieving Olympia-Level Geometry Large Language Model Agent via Complexity Boosting Reinforcement Learning},
  author = {Haiteng Zhao and Junhao Shen and Yiming Zhang and Songyang Gao and Kuikun Liu and Tianyou Ma and Fan Zheng and Dahua Lin and Wenwei Zhang and Kai Chen},
  journal= {arXiv preprint arXiv:2512.10534},
  year   = {2026}
}