WebResearcher: 解锁长期智能体的无限制推理能力
计算与语言
2025-09-23 v2
摘要
近期的深度研究系统进展已展示了 AI 智能体从外部来源自主发现和综合知识的潜力。本文引入 WebResearcher,一种构建此类智能体的新框架,其包含两个关键组件:(1) WebResearcher,一种迭代深度研究范式,将深度研究重新表述为马尔可夫决策过程 (MDP),其中智能体定期整合发现结果到演化报告中,同时维持专注的工作空间,从而克服现有单一上下文方法中常见的上下文窒息和噪声污染问题;(2) WebFrontier,一种可扩展的数据合成引擎,通过工具增强的复杂度提升生成高质量训练数据,系统性地创建能够在被动知识回忆与主动知识构建之间架起桥梁的研究任务。值得注意的是,我们发现该范式产生的训练数据显著提升了传统单一上下文方法的工具使用能力。此外,该范式天然支持并行思维,使并行多智能体探索成为可能,以获得更为全面的结论。广泛的在6个具有挑战性基准上的实验表明,WebResearcher 实现了最先进的性能,即便超过了许多专有系统。
引用
@article{arxiv.2509.13309,
title = {WebResearcher: Unleashing unbounded reasoning capability in Long-Horizon Agents},
author = {Zile Qiao and Guoxin Chen and Xuanzhong Chen and Donglei Yu and Wenbiao Yin and Xinyu Wang and Zhen Zhang and Baixuan Li and Huifeng Yin and Kuan Li and Rui Min and Minpeng Liao and Yong Jiang and Pengjun Xie and Fei Huang and Jingren Zhou},
journal= {arXiv preprint arXiv:2509.13309},
year = {2025}
}
备注
https://tongyi-agent.github.io/blog/introducing-tongyi-deep-research/