中文

SynPlanResearch-R1:通过合成计划鼓励深度研究工具探索

人工智能 2026-03-10 v1 计算与语言 信息检索

摘要

研究代理通过工具从 web 收集信息以回答用户查询,要求它们动态地在内部推理与工具使用之间进行交错。虽然这些能力可以通过可验证奖励的强化学习 (RLVR) 以原则方式学习,但我们注意到代理往往表现出差劲的探索行为,包括过早终止和偏向工具使用。因此,仅靠 RLVR 仅能获得有限的改进。我们提出 SynPlanResearch-R1 框架,通过合成工具使用轨迹来鼓励更深入的探索,以形成冷启动监督微调中的探索行为,为后续 RL 提供强初始化。在七个多跳和开放 web 基准测试中,\framework 相对于 SOTA baseline 在 Qwen3-8B 和 Qwen3-4B 上分别提升了最高可达 6.0% 和 5.8%。进一步分析工具使用模式和训练动力学,揭示了这些提升背后的关键因素。我们的代码已公开于 https://github.com/HansiZeng/syn-plan-research。

关键词

引用

@article{arxiv.2603.07853,
  title  = {SynPlanResearch-R1: Encouraging Tool Exploration for Deep Research with Synthetic Plans},
  author = {Hansi Zeng and Zoey Li and Yifan Gao and Chenwei Zhang and Xiaoman Pan and Tao Yang and Fengran Mo and Jiacheng Lin and Xian Li and Jingbo Shang},
  journal= {arXiv preprint arXiv:2603.07853},
  year   = {2026}
}