中文

基于子目标驱动的提高长期 LLM 智能体框架

人工智能 2026-03-23 v1 机器学习 多智能体系统

摘要

大型语言模型(LLM)based 智能体已涌现为数字环境(包括移动界面、操作系统和网页浏览器)的强大自主控制器。例如,网页导航需要处理动态内容和长序列动作,这在挑战上尤为突出。现有的 LLM-based 智能体在两个主要方面在处理长期计划方面存在困难:在在线执行期间,他们常常无法跟踪新信息,缺乏通向最终目标的清晰且可适应的路径。这一问题在强化学习(RL)微调期间进一步恶化,因为稀疏且延迟的奖励使得智能体难以识别哪些动作导致成功,阻止其在扩展任务上保持连贯的推理。为解决这些挑战,我们提出两个贡献:首先,我们引入一个智能体框架,利用专有模型进行通过子目标分解的在线规划;其次,我们提出 MiRA(Milestoning your Reinforcement Learning Enhanced Agent),一种使用稠密、里程碑式奖励信号的 RL 训练框架。实时规划机制使专有模型(如 Gemini)在 WebArena-Lite 基准测试上的成功率提升约 10%。同时,将 MiRA 应用于开放的 Gemma3-12B 模型后,其成功率从 6.4% 提升至 43.0%。该性能超过专有系统(如 GPT-4-Turbo 17.6% 和 GPT-4o 13.9%)以及前一开放模型最佳成绩 WebRL(38.4%)。总体而言,我们的发现表明,结合显式推理时规划与里程碑式奖励显著提高了智能体的长期能力,为构建更稳健和通用的自主系统铺平了道路。

关键词

引用

@article{arxiv.2603.19685,
  title  = {A Subgoal-driven Framework for Improving Long-Horizon LLM Agents},
  author = {Taiyi Wang and Sian Gooding and Florian Hartmann and Oriana Riva and Edward Grefenstette},
  journal= {arXiv preprint arXiv:2603.19685},
  year   = {2026}
}

备注

50 pages, 15 figures