SWEET-RL:用于协作推理任务的多轮 LLM 代理训练
机器学习
2025-03-20 v1
摘要
大型语言模型 (LLM) 代理需要在真实任务中进行多轮交互。然而,现有的多轮强化学习算法用于优化 LLM 代理,无法在多个回合中有效进行信用分配,同时也无法充分利用 LLM 的泛化能力,这仍是一大挑战。为此,我们首先引入一个新的基准数据集 ColBench,其中 LLM 代理与人类合作者进行多轮交互,以解决后端编程和前端设计中的真实任务。基于该基准,我们提出一种新型强化学习算法,SWEET-RL (Step-WisE Evaluation from Training-time information with RL),该算法设计了 carefully 的优化目标,用于训练拥有额外训练时信息的批评家模型。批评家为改进策略模型提供分步骤的奖励。我们的实验表明,与其他 state-of-the-art 多轮强化学习算法相比,SWEET-RL 在 ColBench 上实现了 6% 的成功率和胜率的绝对提升,使 Llama-3.1-8B 能够在真实的协作内容创建任务中匹配或超越 GPT-4-o 的性能。
引用
@article{arxiv.2503.15478,
title = {SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks},
author = {Yifei Zhou and Song Jiang and Yuandong Tian and Jason Weston and Sergey Levine and Sainbayar Sukhbaatar and Xian Li},
journal= {arXiv preprint arXiv:2503.15478},
year = {2025}
}
备注
29 pages, 16 figures