OffSeeker:在线强化学习并非构建深度研究智能体的全部所需
人工智能
2026-02-24 v2 机器学习
摘要
深度研究智能体在处理长周期任务方面展现出了巨大潜力。然而,当前最先进的性能通常依赖于在线强化学习(RL),由于大量的 API 调用,其成本高昂。虽然离线训练提供了更高效的替代方案,但其进展受到高质量研究轨迹稀缺的阻碍。在本文中,我们证明构建强大的研究智能体并非完全需要昂贵的在线强化学习。为了弥合这一差距,我们引入了一套专为有效离线训练设计的完全开源工具包。我们的核心贡献包括 DeepForge,这是一个即插即用的任务合成框架,无需繁重的预处理即可生成大规模研究查询;以及精选的 66k QA 对、33k SFT 轨迹和 21k DPO 对。利用这些资源,我们完全以离线方式训练了 OffSeeker (8B) 模型。在六个基准测试上的广泛评估表明,OffSeeker 不仅在同等规模的智能体中处于领先地位,而且与通过重度在线 RL 训练的 30B 参数系统相比也保持了竞争力。
引用
@article{arxiv.2601.18467,
title = {OffSeeker: Online Reinforcement Learning Is Not All You Need for Deep Research Agents},
author = {Yuhang Zhou and Kai Zheng and Qiguang Chen and Mengkang Hu and Qingfeng Sun and Can Xu and Jingjing Chen},
journal= {arXiv preprint arXiv:2601.18467},
year = {2026}
}