Marco DeepResearch:通过以验证为中心的设计释放高效深度研究智能体
计算与语言
2026-03-31 v1 人工智能
摘要
深度研究智能体自主开展开放式调查,整合复杂的信息检索与跨多种来源的多步推理,以解决现实世界问题。为了在长期任务中维持这一能力,在训练和推理过程中可靠的验证至关重要。现有范式的一个主要瓶颈源于QA数据合成、轨迹构建和测试时扩展中缺乏显式验证机制。每个阶段引入的错误会向下游传播并降低整体智能体性能。为此,我们提出了Marco DeepResearch,一个通过三层验证中心框架设计优化的深度研究智能体:(1)QA数据合成:我们引入验证机制到基于图和基于智能体的QA合成中,以控制问题难度同时确保答案唯一且正确;(2)轨迹构建:我们设计了一种验证驱动的轨迹合成方法,将显式验证模式注入训练轨迹;(3)测试时扩展:我们在推理时将Marco DeepResearch本身用作验证器,并有效提升了挑战性问题的性能。大量实验结果表明,我们提出的Marco DeepResearch智能体在大多数最具挑战性的基准测试(如BrowseComp和BrowseComp-ZH)上显著超越了8B规模的深度研究智能体。关键的是,在最多600次工具调用的预算下,Marco DeepResearch甚至超越或接近了多个30B规模的智能体,如Tongyi DeepResearch-30B。
引用
@article{arxiv.2603.28376,
title = {Marco DeepResearch: Unlocking Efficient Deep Research Agents via Verification-Centric Design},
author = {Bin Zhu and Qianghuai Jia and Tian Lan and Junyang Ren and Feng Gu and Feihu Jiang and Longyue Wang and Zhao Xu and Weihua Luo},
journal= {arXiv preprint arXiv:2603.28376},
year = {2026}
}