DeepWeb-Bench:大规模跨源证据与长程推导的数据集
人工智能
2026-05-21 v1
摘要
深度研究即智能体搜索开放网络、收集证据并通过扩展推理得出答案,是前沿语言模型的突出用例。前沿深度研究产品在现有基准上得分高,使其能力难以仅凭评估数据加以区分。我们引入 DeepWeb-Bench,这是一个远超现有前沿基准难度的深度研究基准。难度来源于数据本身的三个属性:每个任务需要大规模证据收集、跨源协调和长程多步骤推导。我们将这三种难度表示为四个能力家族(检索、推导、推理和校准),按家族报告结果。每个参考答案都伴随四级披露层级的来源可追溯记录,并在可用情况下进行跨源检查,便于就底层证据对分数进行审计。我们对九个前沿模型进行评估,并报告三个发现:(1)检索并非瓶颈,因为检索失败仅占错误的12-14%,而推导和校准失败占超过70%;(2)强模型和弱模型出错方式在质料上有显著差异,强模型的错误主要由不完整的推导导致,弱模型的错误则由幻觉的精确性导致;(3)模型在不同领域 exhibits 真实的专业化,跨模型间一致性仅为 rho = 0.61,单案例不一致可达18.8个百分点。该公开基准发布包括数据、评分标准和评估代码。
引用
@article{arxiv.2605.21482,
title = {DeepWeb-Bench: A Deep Research Benchmark Demanding Massive Cross-Source Evidence and Long-Horizon Derivation},
author = {Sixiong Xie and Zhuofan Shi and Haiyang Shen and Jiuzheng Wang and Siqi Zhong and Mugeng Liu and Chongyang Pan and Peilun Jia and Baoqing Sun and Xiang Jing and Yun Ma},
journal= {arXiv preprint arXiv:2605.21482},
year = {2026}
}
备注
Work in Progress. 27 pages, 10 figures, 4 tables. Project page: https://sixiongxie1001-dot.github.io/deep-research-benchmark2.0