DeepResearcher:在真实环境中通过强化学习扩展深度研究
人工智能
2025-04-18 v4 计算与语言
机器学习
摘要
配备网络搜索能力的大型语言模型(LLMs)在深度研究任务中展现出令人瞩目的潜力。然而,当前方法主要依赖人工设计的提示(基于提示工程),其性能脆弱,或是在受控的检索增强生成(RAG)环境(基于RAG)中进行强化学习,无法捕捉真实世界交互的复杂性。本文中,我们提出DeepResearcher,这是首个通过在实际网络搜索交互的真实环境中扩展强化学习(RL)来端到端训练基于LLM的深度研究智能体的综合框架。与假设所有必要信息存在于固定语料库中的基于RAG的方法不同,我们的方法训练智能体在开放网络的嘈杂、非结构化和动态特性中导航。我们实现了一种专门的多智能体架构,其中浏览智能体从各种网页结构中提取相关信息,并克服了重大技术挑战。在开放域研究任务上的大量实验表明,DeepResearcher相比基于提示工程的基线取得了高达28.9分的显著提升,相比基于RAG的RL智能体提升了高达7.2分。我们的定性分析揭示了端到端RL训练中涌现的认知行为,包括制定计划的能力、从多个来源交叉验证信息、进行自我反思以重新定向研究,以及在无法找到确定答案时保持诚实。我们的结果强调,在真实网络环境中进行端到端训练不仅是实现细节,更是开发与现实应用一致的稳健研究能力的基本要求。我们在https://github.com/GAIR-NLP/DeepResearcher发布DeepResearcher。
引用
@article{arxiv.2504.03160,
title = {DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments},
author = {Yuxiang Zheng and Dayuan Fu and Xiangkun Hu and Xiaojie Cai and Lyumanshan Ye and Pengrui Lu and Pengfei Liu},
journal= {arXiv preprint arXiv:2504.03160},
year = {2025}
}