中文

O-Researcher:通过多智能体蒸馏和智能体强化学习的开放式深度研究模型

计算与语言 2026-01-08 v1 人工智能

摘要

大型语言模型(LLM)在闭源与开源之间的性能差异在很大程度上归因于对高质量训练数据的获取差异。为弥合这一差距,我们引入了一个用于自动合成高级研究级指令数据的新框架。我们的方案核心是多智能体工作流程,其中协作式AI智能体模拟复杂的工具集成推理,以端到端方式生成多样且高保真数据。借助这些合成数据,我们开发了两阶段训练策略,集成监督微调与新颖的强化学习方法,以最大化模型的对齐程度和能力。大量实验表明,我们的框架使开源模型在多个规模上都能实现新的状态在先性能,涵盖主要的深度研究基准。这一工作为在不依赖专有数据或模型的前提下,推进开源LLM提供了可扩展且有效的路径。

关键词

引用

@article{arxiv.2601.03743,
  title  = {O-Researcher: An Open Ended Deep Research Model via Multi-Agent Distillation and Agentic RL},
  author = {Yi Yao and He Zhu and Piaohong Wang and Jincheng Ren and Xinlong Yang and Qianben Chen and Xiaowan Li and Dingfeng Shi and Jiaxian Li and Qiexiang Wang and Sinuo Wang and Xinpeng Liu and Jiaqi Wu and Minghao Liu and Wangchunshu Zhou},
  journal= {arXiv preprint arXiv:2601.03743},
  year   = {2026}
}

备注

22 pages