中文

L0:强化学习通往通用智能体

计算与语言 2025-07-01 v1

摘要

训练大型语言模型(LLM)作为多轮、长期程度任务的自治智能体,仍面临规模和训练效率的重大挑战。为此,我们引入 L-Zero(L0),一个可扩展的面向通用智能体的端到端训练管道。L0 特点是低成本、可扩展且隔离的并发智能体工作池,降低了在复杂环境中应用强化学习的门槛。我们还引入了 L0 中的 NB-Agent,即智能体脚手架,其通过读-求-印-循环(REPL)以“代码即动作”方式运行。我们在事实性问答基准测试中评估了 L0。我们的实验表明,仅凭强化学习可验证奖励(RLVR),基础模型即可发展出鲁棒的问题解决能力。在 Qwen2.5-7B-Instruct 模型上,我们的方法将 SimpleQA 的准确率从 30% 提升至 80%,HotpotQA 的准确率从 22% 提升至 41%。我们已开源整个 L0 系统,包括 L0 系列模型、NB-Agent、完整的训练管道以及相应的训练配方(https://github.com/cmriat/l0)。

关键词

引用

@article{arxiv.2506.23667,
  title  = {L0: Reinforcement Learning to Become General Agents},
  author = {Junjie Zhang and Jingyi Xi and Zhuoyang Song and Junyu Lu and Yuhua Ke and Ting Sun and Yukun Yang and Jiaxing Zhang and Songxin Zhang and Zejian Xie},
  journal= {arXiv preprint arXiv:2506.23667},
  year   = {2025}
}