中文

ScholarGym:面向深度研究信息收集阶段的大语言模型能力基准测试

人工智能 2026-02-18 v3

摘要

大语言模型已从单轮问答发展为能够迭代分解研究问题、调用检索工具并跨多轮综合信息的深度研究系统。通常情况下,评估此类系统涉及对最终研究报告进行整体打分,但这种端到端方法将语言模型的决策、工作流程设计与环境反馈紧密耦合,阻碍对各个组成部分进行可分解分析。我们提出ScholarGym,一种隔离深度研究信息收集阶段的评估环境。该环境在统一工作流程下,将研究过程分解为三个明确阶段——查询规划、工具调用和相关性评估——并针对由2,536个专家标注查询构成的静态语料库(包含57万篇学术论文)进行评估。系统实验揭示,迭代查询分解相对于单查询检索可实现2.9–3.3倍的F1提升,具有延长思考能力的模型在召回率与精确率之间进行权衡,查询规划质量以及相关性评估共同构成了双重瓶颈,分别分离了专有模型与开源模型的性能。

关键词

引用

@article{arxiv.2601.21654,
  title  = {ScholarGym: Benchmarking Large Language Model Capabilities in the Information-Gathering Stage of Deep Research},
  author = {Hao Shen and Hang Yang and Zhouhong Gu and Weili Han},
  journal= {arXiv preprint arXiv:2601.21654},
  year   = {2026}
}