L0:强化学习通往通用智能体
计算与语言
2025-07-01 v1
摘要
训练大型语言模型(LLM)作为多轮、长期程度任务的自治智能体,仍面临规模和训练效率的重大挑战。为此,我们引入 L-Zero(L0),一个可扩展的面向通用智能体的端到端训练管道。L0 特点是低成本、可扩展且隔离的并发智能体工作池,降低了在复杂环境中应用强化学习的门槛。我们还引入了 L0 中的 NB-Agent,即智能体脚手架,其通过读-求-印-循环(REPL)以“代码即动作”方式运行。我们在事实性问答基准测试中评估了 L0。我们的实验表明,仅凭强化学习可验证奖励(RLVR),基础模型即可发展出鲁棒的问题解决能力。在 Qwen2.5-7B-Instruct 模型上,我们的方法将 SimpleQA 的准确率从 30% 提升至 80%,HotpotQA 的准确率从 22% 提升至 41%。我们已开源整个 L0 系统,包括 L0 系列模型、NB-Agent、完整的训练管道以及相应的训练配方(https://github.com/cmriat/l0)。
引用
@article{arxiv.2506.23667,
title = {L0: Reinforcement Learning to Become General Agents},
author = {Junjie Zhang and Jingyi Xi and Zhuoyang Song and Junyu Lu and Yuhua Ke and Ting Sun and Yukun Yang and Jiaxing Zhang and Songxin Zhang and Zejian Xie},
journal= {arXiv preprint arXiv:2506.23667},
year = {2025}
}