WebAgent-R1:通过端到端多回合强化学习训练 Web 代理
计算与语言
2025-10-10 v2 机器学习
摘要
尽管强化学习(RL)在增强大语言模型(LLM)方面取得了显著成功,但其主要聚焦于单回合任务,如解答数学问题。训练有效的 Web 代理以应对多回合交互仍具有挑战性,因为需要在动态网页界面之间进行复杂的长期决策。本文提出 WebAgent-R1,一个简单而有效的端到端多回合 RL 框架,用于训练 Web 代理。它直接从与网页环境的在线交互中学习,通过异步生成多样化轨迹,完全由任务成功的二元奖励驱动。实验在 WebArena-Lite 基准测试上表明,WebAgent-R1 在 Qwen-2.5-3B 从 6.1% 提升至 33.9%,Llama-3.1-8B 从 8.5% 提升至 44.8%,显著优于现有最先进方法和诸如 OpenAI o3 等专有模型。在深入分析中,我们发现基于思考的提示策略以及通过增加交互次数实现测试时扩展在 Web 任务中的有效性。我们进一步研究了不同的 RL 初始化策略,提出两种变体,即 WebAgent-R1-Zero 和 WebAgent-R1-CoT,这两种方法突显了 warm-up 训练阶段(即行为克隆)的重要性,并就在 Web 代理中融入长链思维(CoT)推理提供了见解。
关键词
引用
@article{arxiv.2505.16421,
title = {WebAgent-R1: Training Web Agents via End-to-End Multi-Turn Reinforcement Learning},
author = {Zhepei Wei and Wenlin Yao and Yao Liu and Weizhi Zhang and Qin Lu and Liang Qiu and Changlong Yu and Puyang Xu and Chao Zhang and Bing Yin and Hyokun Yun and Lihong Li},
journal= {arXiv preprint arXiv:2505.16421},
year = {2025}
}
备注
EMNLP 2025. Code: https://github.com/weizhepei/WebAgent-R1