中文

DeepResearch-9K:深度研究智能体的挑战性基准数据集

人工智能 2026-03-03 v1

摘要

深度研究智能体能够执行多步骤网页探索、精准检索和复杂问题解答。尽管具有强大的能力,深度研究智能体仍面临两个关键瓶颈:(1)缺乏具有真实难度的大规模挑战性数据集,(2)缺乏可访问的开源框架用于数据合成和智能体训练。为弥合这些差距,我们首先构建 DeepResearch-9K,一个专为深度研究场景设计的大规模挑战性数据集,由开源多跳问答数据集通过低成本自主管道构建而成。值得注意的是,它包含(1)覆盖 L1 到 L3 三个难度等级的 9000 个问题、(2)来自最新深度研究智能体 Tongyi-DeepResearch-30B-A3B 的高质量搜索轨迹和推理链、(3)可验证的答案。此外,我们开发了一个开源训练框架 DeepResearch-R1,支持(1)多轮网页交互、(2)不同的强化学习方法、(3)各种奖励模型,如基于规则的结果奖励和 LLM-as-judge 反馈。最终,经验结果表明,在 DeepResearch-R1 下训练的智能体在挑战性深度研究基准测试中实现了最先进的性能。我们在https://huggingface.co/datasets/artillerywu/DeepResearch-9K 上发布 DeepResearch-9K 数据集,并在https://github.com/Applied-Machine-Learning-Lab/DeepResearch-R1 上发布 DeepResearch-R1 代码。

关键词

引用

@article{arxiv.2603.01152,
  title  = {DeepResearch-9K: A Challenging Benchmark Dataset of Deep-Research Agent},
  author = {Tongzhou Wu and Yuhao Wang and Xinyu Ma and Xiuqiang He and Shuaiqiang Wang and Dawei Yin and Xiangyu Zhao},
  journal= {arXiv preprint arXiv:2603.01152},
  year   = {2026}
}

备注

6 pages, 4 figures