中文

AlphaApollo:深度智能体推理系统

人工智能 2026-03-11 v2 计算与语言 机器学习

摘要

我们提出AlphaApollo,这是一个针对基础模型推理中两个瓶颈的智能体推理系统:(1) 用于解决复杂、长期视角问题的推理能力有限,(2) 在缺乏可靠验证的情况下测试时演化不可靠。AlphaApollo 通过三大组件编排模型与工具:(i) 多轮智能体推理,通过结构化工具调用和响应形式化模型-环境交互;(ii) 多轮智能体学习,应用轮级强化学习优化工具使用推理,同时将动作与工具响应解耦以实现稳定训练;(iii) 多轮智能体演化,通过提议-评判-更新循环实现解决方案的细化,辅以工具验证和长期记忆。在七个数学推理基准和多种模型规模上,AlphaApollo 通过可靠工具使用(>85%工具调用成功率)、来自多轮RL的显著提升(平均@32:Qwen2.5-1.5B-Instruct从1.07%提升至9.64%,Qwen2.5-7B-Instruct从8.77%提升至20.35%)以及演化带来的改进(例如Qwen2.5-3B-Instruct从5.27%提升至7.70%,Qwen2.5-14B-Instruct从16.53%提升至21.08%)提升了性能。该项目仍在持续进行中。我们欢迎社区反馈,并将不断更新源代码和技术报告。

关键词

引用

@article{arxiv.2510.06261,
  title  = {AlphaApollo: A System for Deep Agentic Reasoning},
  author = {Zhanke Zhou and Chentao Cao and Xiao Feng and Xuan Li and Zongze Li and Xiangyu Lu and Jiangchao Yao and Weikai Huang and Tian Cheng and Jianghangfan Zhang and Tangyu Jiang and Linrui Xu and Yiming Zheng and Brando Miranda and Tongliang Liu and Sanmi Koyejo and Masashi Sugiyama and Bo Han},
  journal= {arXiv preprint arXiv:2510.06261},
  year   = {2026}
}

备注

Ongoing project