中文

WebRL:通过自演化在线课程强化学习训练大语言模型网络智能体

计算与语言 2025-01-28 v3

摘要

大语言模型(LLM)在自主智能体任务中展现出显著潜力,特别是在网络任务方面。然而,现有的LLM网络智能体严重依赖昂贵的专有LLM API,而开放LLM缺乏必要的决策能力。本文提出WebRL,一个自演化在线课程强化学习框架,旨在使用开放LLM训练高性能网络智能体。WebRL解决了构建LLM网络智能体的三个关键挑战,包括训练任务的稀缺性、稀疏反馈信号以及在线学习中的策略分布漂移。具体而言,WebRL包含:1)一个自演化课程,从未成功的尝试中生成新任务;2)一个鲁棒的结局监督奖励模型(ORM);3)自适应强化学习策略以确保持续改进。我们将WebRL应用于将开放的Llama-3.1和GLM-4模型转化为熟练的网络智能体。在WebArena-Lite上,WebRL将Llama-3.1-8B的成功率从4.8%提升至42.4%,将GLM-4-9B从6.1%提升至43%。这些开放模型显著超越了GPT-4-Turbo(17.6%)和GPT-4o(13.9%)的性能,并优于此前在开放LLM上训练的网络智能体最新方法(AutoWebGLM,18.2%)。我们的发现表明WebRL在弥合基于开放LLM和专有LLM的网络智能体之间的差距方面具有有效性,为更易获取且更强大的自主网络交互系统铺平了道路。

关键词

引用

@article{arxiv.2411.02337,
  title  = {WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning},
  author = {Zehan Qi and Xiao Liu and Iat Long Iong and Hanyu Lai and Xueqiao Sun and Wenyi Zhao and Yu Yang and Xinyue Yang and Jiadai Sun and Shuntian Yao and Tianjie Zhang and Wei Xu and Jie Tang and Yuxiao Dong},
  journal= {arXiv preprint arXiv:2411.02337},
  year   = {2025}
}

备注

Published as a conference paper at ICLR 2025