中文

大语言模型推理前沿调查:推理扩放、学习推理与智能体系统

人工智能 2026-03-18 v4 计算与语言

摘要

推理是一种基本认知过程,使能够进行逻辑推断、解决问题和做出决策。随着大语言模型(LLM)的快速发展,推理已成为能够区分先进AI系统与传统模型的关键能力,这些模型为聊天机器人提供了动力。在本调查中,我们在两个正交维度上对现有方法进行分类:(1) 阶段,定义了推理实现的时点(要么是在推理时间,要么通过专门的训练);和(2) 架构,确定推理过程中涉及的组件,区分standalone LLM与集成外部工具和多智能体协作的智能体复合系统。在每个维度内,我们分析了两个关键视角:(1) 输入层级,聚焦于构建高质量提示的技术,这些提示是LLM所依赖的;和(2) 输出层级,方法通过精炼多个抽样候选来提高推理质量。这种分类提供了对LLM推理不断演变的景观进行系统性理解,突出了诸如从推理扩放向学习推理(例如DeepSeek-R1)的转变,以及向智能体工作流程的转变(例如OpenAI Deep Research、Manus Agent)等新兴趋势。此外,我们涵盖了广泛的学习算法,从监督微调到强化学习如PPO和GRPO,以及推理器和验证器的训练。我们还检查了智能体工作流程的关键设计,从诸如生成器-评估器和LLM辩论等既定模式到最近的创新。...

关键词

引用

@article{arxiv.2504.09037,
  title  = {A Survey of Frontiers in LLM Reasoning: Inference Scaling, Learning to Reason, and Agentic Systems},
  author = {Zixuan Ke and Fangkai Jiao and Yifei Ming and Xuan-Phi Nguyen and Austin Xu and Do Xuan Long and Minzhi Li and Chengwei Qin and Peifeng Wang and Silvio Savarese and Caiming Xiong and Shafiq Joty},
  journal= {arXiv preprint arXiv:2504.09037},
  year   = {2026}
}

备注

72 pages, 6 figures. Accepted to TMLR, with Survey Certification award