重新思考基于强化学习的深度研究智能体设计
人工智能
2026-02-24 v4
摘要
大型语言模型 (LLM) 增强的外部工具正在作为深度研究智能体部署,收集、推理并综合网络信息以回答复杂查询。尽管最近的开源系统通过网络交互获得强化学习实现了强大的实证性能,但关键设计选择的影响仍未充分探讨。我们将深度研究形式化为有限马尔可夫决策过程中的强化学习,并构建了一个基于此框架的具竞争力的基线智能体。基于此基础,我们系统性地检视训练与推理阶段的关键设计决策,识别出四项显著提升性能的因素:用来自 LLM 裁判的 AI 反馈取代规则基奖励、使用基于 on-policy 的 RLOO 算法而非基于 off-policy 的 GRPO 算法进行微调、过滤低质量训练样本、采用容错的测试时 rollout 策略。综合这些设计选择,构建的深度研究智能体在十个广泛使用的基准测试中实现了 7B 规模智能体的最佳性能。
引用
@article{arxiv.2510.15862,
title = {Rethinking the Design of Reinforcement Learning-Based Deep Research Agents},
author = {Yi Wan and Jiuqi Wang and Liam Li and Jinsong Liu and Ruihao Zhu and Zheqing Zhu},
journal= {arXiv preprint arXiv:2510.15862},
year = {2026}
}