中文

超级研究:通过超深层和超宽检索回答大语言模型的高度复杂问题

计算与语言 2026-03-04 v2

摘要

尽管大语言模型(LLMs)在 Deep Research 或 Wide Search 上已展现出色,但解决高度复杂问题的能力——即需要长期规划、大规模证据收集和跨异构来源的综合——仍基本未被探索。我们提出了 Super Research,这是一个集成(i) 结构化分解为研究计划、(ii) 超宽检索获取多样视角、(iii) 超深调查通过迭代查询解决不确定性的复杂自主研究任务。为评估这一能力,我们精选了 300 个专家编写的跨领域问题,每个问题可能需要 100+ 次检索步骤和 1,000+ 个网页来调和矛盾证据。Super Research 生成可验证的报告,提供细粒度引用和中间产物(如提纲和表格),以确保可追溯的推理。此外,我们提出了基于图的审计协议,对 Super Research 从五个维度进行评估:覆盖范围、逻辑一致性、报告实用性、客观性和引用健康度。虽然超复杂问题在标准应用中可能不常见,但 Super Research 作为关键的上限评估和压力测试,对于 LLM 能力至关重要。在 Super Research 中的模型专业能力是其通用研究能力的强有力指示;成功表现表明该模型具备导航几乎任何从属研究任务所需的鲁棒性。 leaderboard 可在:https://cnsdqd-dyb.github.io/Super-Research-Benchmark/ 查看。

关键词

引用

@article{arxiv.2603.00582,
  title  = {Super Research: Answering Highly Complex Questions with Large Language Models through Super Deep and Super Wide Research},
  author = {Yubo Dong and Nianhao You and Yuxuan Hou and Zixun Sun and Yue Zhang and Liang Zhang and Siyuan Zhao and Hehe Fan},
  journal= {arXiv preprint arXiv:2603.00582},
  year   = {2026}
}