中文

如何训练你的深度研究智能体?检索-R1中的提示、奖励与策略优化

计算与语言 2026-02-24 v1

摘要

深度研究智能体通过多轮检索和面向决策的生成来解决知识密集型任务。尽管强化学习(RL)在这一范式中已显示出改进性能的潜力,但其贡献仍未得到充分探索。为充分理解RL的作用,我们沿着三个解耦的维度进行系统性研究:提示模板、奖励函数和策略优化。我们的研究揭示了:1)Fast Thinking模板在稳定性和性能上优于先前工作中使用的Slow Thinking模板;2)基于F1的奖励因训练崩溃(由答案回避驱动)而低于EM,这通过纳入行动级别的惩罚项可被缓解,最终超越EM;3)REINFORCE在需要更少检索动作的情况下优于PPO,而GRPO在策略优化方法中表现最差。基于这些洞见,我们随后引入了Search-R1++,一个强基准,使Search-R1在Qwen2.5-7B上的性能从0.403提升至0.442,在Qwen2.5-3B上从0.289提升至0.331。我们希望这些发现为深度研究系统的更原则且可靠的RL训练策略铺平道路。

关键词

引用

@article{arxiv.2602.19526,
  title  = {How to Train Your Deep Research Agent? Prompt, Reward, and Policy Optimization in Search-R1},
  author = {Yinuo Xu and Shuo Lu and Jianjie Cheng and Meng Wang and Qianlong Xie and Xingxing Wang and Ran He and Jian Liang},
  journal= {arXiv preprint arXiv:2602.19526},
  year   = {2026}
}