QUEST:使用完全合成任务训练前沿深度研究智能体
计算与语言
2026-05-26 v1
摘要
深度研究智能体将搜索引擎的角色从检索关键词匹配页面扩展到综合知识,从根本上改变了人类与信息交互的方式。然而,前沿系统仍属专有,而现有的开源智能体往往在不同任务类型上泛化能力较差,导致不清楚如何训练一个具备广泛能力的深度研究智能体。我们发布 QUEST,一套面向通用深度研究智能体的开放模型(规模从 2B 至 35B),专为处理广泛范围的长期程度搜索任务而设计,在事实寻求、引用锚定和报告综合方面表现出强大的能力。为构建 QUEST,我们提出了一种有效的训练配方,结合中期训练、监督式微调和强化学习。该配方的核心是基于统一评分树构建的精选数据合成管道,该管道适用于不同任务类型,并可在无需人工标注的情况下合成带有可验证奖励的训练数据。此外,QUEST 集成了内置的上下文管理机制,使其能够有效地进行长期程度推理和知识综合。仅使用 8K 个合成任务,QUEST 就能在覆盖多样任务类型的八个深度研究基准上接近或超越前沿闭源智能体,并在最近的开源重量模型中实现最佳整体性能。我们发布了所有内容:模型、数据和训练脚本。
引用
@article{arxiv.2605.24218,
title = {QUEST: Training Frontier Deep Research Agents with Fully Synthetic Tasks},
author = {Jian Xie and Tianhe Lin and Zilu Wang and Yuting Ning and Yuekun Yao and Tianci Xue and Zhehao Zhang and Zhongyang Li and Kai Zhang and Yufan Wu and Shijie Chen and Boyu Gou and Mingzhe Han and Yifei Wang and Vint Lee and Xinpeng Wei and Xiangjun Wang and Yu Su and Huan Sun},
journal= {arXiv preprint arXiv:2605.24218},
year = {2026}
}
备注
Work in Progress