中文

Web2BigTable:面向互联网规模信息搜索与提取的双层多智能体 LLM 系统

人工智能 2026-05-01 v1

摘要

智能体式网页搜索正面临两个 distinct 需求:对单个目标进行深层推理,以及跨越多个实体和异构来源的结构化聚合。当前系统在这两个方面都难以胜任。广度导向任务需要模式对齐的输出,以实现广泛覆盖和跨实体一致性;而深度导向任务则需要在长时间、分支的搜索轨迹上进行连贯推理。我们引入 Web2BigTable,一个面向网页到表格搜索的多智能体框架,支持这两种场景。Web2BigTable 采用双层架构,上层 orchestrator 将任务分解为子问题,下层 worker 智能体并行解决这些子问题。通过闭环的 run-verify-reflect 流程,该框架通过持续的人类可读外部记忆实现分解和执行的联合改进,并对每个单一智能体进行自我演化更新。在执行期间,worker 通过共享工作区进行协调,该工作区使部分发现结果可见,从而减少冗余探索、调和冲突证据并适应新出现的覆盖缺口。Web2BigTable 在 WideSearch 上取得了新的最佳纪录,Avg@4 Success Rate 达到 \textbf{38.50}(是第二名的 5.10 的 7.5 倍),Row F1 为 \textbf{63.53}(超过第二名的 25.03),Item F1 为 \textbf{80.12}(超过第二名的 14.42)。它还推广到 XBench-DeepSearch 上的深度搜索任务,达到了 73.0 的准确率。代码已公开 https://github.com/web2bigtable/web2bigtable。

关键词

引用

@article{arxiv.2604.27221,
  title  = {Web2BigTable: A Bi-Level Multi-Agent LLM System for Internet-Scale Information Search and Extraction},
  author = {Yuxuan Huang and Yihang Chen and Zhiyuan He and Yuxiang Chen and Ka Yiu Lee and Huichi Zhou and Weilin Luo and Meng Fang and Jun Wang},
  journal= {arXiv preprint arXiv:2604.27221},
  year   = {2026}
}