OpenSeeker-v2:利用信息丰富且高难度的轨迹突破搜索智能体的极限
人工智能
2026-05-06 v1 计算与语言
摘要
深度搜索能力已成为前沿大语言模型 (LLM) 智能体不可或缺的能力,但其发展仍由工业界巨头主导。典型的工业界方案涉及一个高度资源密集型的流程,涵盖预训练、持续预训练 (CPT)、监督微调 (SFT) 和强化学习 (RL)。在本报告中,我们表明,当以信息丰富且高难度的轨迹为驱动时,简单的 SFT 方法在训练前沿搜索智能体方面能展现出惊人的强大效果。通过引入三项简单的数据合成修改:扩大知识图谱规模以实现更丰富的探索、扩展工具集规模以实现更广泛的功能,以及严格的低步骤过滤,我们建立了一个更强的基线。仅使用 10.6k 个数据点进行训练,我们的 OpenSeeker-v2 在 4 个基准测试上取得了 SOTA 性能(采用 ReAct 范式的 30B 规模智能体):BrowseComp 上 46.0%,BrowseComp-ZH 上 58.1%,Humanity's Last Exam 上 34.6%,xbench 上 78.0%,甚至超越了通过繁重的 CPT+SFT+RL 流程训练的 Tongyi DeepResearch(其成绩分别为 43.4%、46.7%、32.9% 和 75.0%)。值得注意的是,OpenSeeker-v2 是首个在其模型规模和范式内,由纯学术团队仅使用 SFT 开发的 SOTA 搜索智能体。我们很高兴开源 OpenSeeker-v2 模型权重,并分享我们简单而有效的发现,使前沿搜索智能体研究更易于社区参与。
引用
@article{arxiv.2605.04036,
title = {OpenSeeker-v2: Pushing the Limits of Search Agents with Informative and High-Difficulty Trajectories},
author = {Yuwen Du and Rui Ye and Shuo Tang and Keduan Huang and Xinyu Zhu and Yuzhu Cai and Siheng Chen},
journal= {arXiv preprint arXiv:2605.04036},
year = {2026}
}
备注
7 pages