中文

WideSeek-R1:通过多智能体强化学习探索宽度扩展以实现广泛信息检索

人工智能 2026-03-13 v3 机器学习 多智能体系统

摘要

大型语言模型(LLM)的最新进展主要集中在深度扩展,即单个智能体通过多轮推理和工具使用来解决长期问题。然而,随着任务范围的扩大,关键瓶颈从单个能力转向组织能力。在本工作中,我们探索了宽度扩展的另一维度,通过多智能体系统来解决广泛信息检索。现有的多智能体系统通常依赖手工制作的工作流程和轮流交互,无法有效并行处理工作。为弥合这一差距,我们提出 WideSeek-R1,一个基于多智能体强化学习(MARL)训练的领导智能体-子智能体框架,以协同可扩展的编排和并行执行为目标。通过使用具有隔离上下文和专用工具的共享 LLM,WideSeek-R1 在包含 2 万个广泛信息检索任务的精选数据集上,联合优化领导智能体和并行子智能体。大量实验表明,WideSeek-R1-4B 在 WideSearch 数据集上实现 40.0% 的项目 F1 分数,这相当于单智能体 DeepSeek-R1-671B 的性能。此外,WideSeek-R1-4B 随并行子智能体数量的增加而表现出一致的性能提升,凸显了宽度扩展的有效性。

关键词

引用

@article{arxiv.2602.04634,
  title  = {WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement Learning},
  author = {Zelai Xu and Zhexuan Xu and Ruize Zhang and Chunyang Zhu and Shi Yu and Weilin Liu and Quanlu Zhang and Wenbo Ding and Chao Yu and Yu Wang},
  journal= {arXiv preprint arXiv:2602.04634},
  year   = {2026}
}

备注

https://wideseek-r1.github.io/