中文

LLM 智能体强化学习的格局:一项综述

人工智能 2026-04-21 v5 计算与语言

摘要

智能体强化学习(Agentic RL)的出现标志着从应用于大语言模型(LLM RL)的传统强化学习范式的范式转变,将 LLM 从被动的序列生成器转变为嵌入复杂动态世界中的自主决策智能体。本综述通过对比 LLM-RL 中单步骤马尔可夫决策过程(MDPs)的退化情况与 Agentic RL 中定义的时延扩展、部分可观测马尔可夫决策过程(POMDPs),来正式化化这一概念性转变。基于此基础,我们提出了综合的双重分类体系:一种围绕核心智能体能力,包括规划、工具使用、记忆、推理、自我改进和感知;另一种围绕其在不同任务领域中的应用。我们的核心论点是,强化学习是将这些能力从静态、启发式模块转化为自适应、稳健智能体行为的关键机制。为支持和加速未来研究,我们将归档的开源环境、基准和框架整合成实用丛书。通过综合超过 500 项近期工作,本综述勾勒了这一快速演化领域的轮廓,并突出了将塑造可扩展通用 AI 智能体发展的机遇与挑战。

关键词

引用

@article{arxiv.2509.02547,
  title  = {The Landscape of Agentic Reinforcement Learning for LLMs: A Survey},
  author = {Guibin Zhang and Hejia Geng and Xiaohang Yu and Zhenfei Yin and Zaibin Zhang and Zelin Tan and Heng Zhou and Zhongzhi Li and Xiangyuan Xue and Yijiang Li and Yifan Zhou and Yang Chen and Chen Zhang and Yutao Fan and Zihu Wang and Songtao Huang and Francisco Piedrahita-Velez and Yue Liao and Hongru Wang and Mengyue Yang and Heng Ji and Jun Wang and Shuicheng Yan and Philip Torr and Lei Bai},
  journal= {arXiv preprint arXiv:2509.02547},
  year   = {2026}
}

备注

Published on Transactions on Machine Learning Research: https://openreview.net/forum?id=RY19y2RI1O