开放数据合成用于深度研究
计算与语言
2025-09-03 v1 人工智能
摘要
大语言模型(LLMs)正越来越被期望超越简单事实性查询,挑战需要将问题分解为子问题、协调多步推理,并综合来自多源信息的证据。我们将深度研究任务formalized为具有可验证答案的层次约束满足问题(Hierarchical Constraint Satisfaction Problems, HCSPs),其本质上与单约束、多跳或平坦 CSP 形式截然不同。然而,现有基准(如 Natural Questions、HotpotQA)未能捕捉这种复杂性,而近期合成数据集常引入shortcut reasoning、knowledge leakage或缺乏足够的结构深度。为填补这一空白,我们引入 InfoSeek,一个用于合成复杂深度研究任务的可扩展框架。InfoSeek 使用双智能体系统递归构建研究树,从大规模网页中模糊中间节点为有效子问题,并将这些树转换为需要遍历整个层次结构的自然语言问题。该框架还实现了快速扩展,产生超过 5 万训练样本、精选测试集,以及经reject抽样生成的推理轨迹。实验表明,在 InfoSeek 上训练的模型持续优于强大基准。在一个具有挑战性的基准 BrowseComp-Plus 上,3B 参数的 LLMs 使用 InfoSeek 优化后超越了更大规模的 32B 模型和轻量商业 API(如 Gemini2.5-Flash),同时达到更强 API(如 Gemini2.5-Pro)的性能。通过保留中间步骤和检索标签等元信息,InfoSeek 进一步支持高级优化策略,包括复合奖励设计和轨迹级探索。我们提供代码和数据集。
引用
@article{arxiv.2509.00375,
title = {Open Data Synthesis For Deep Research},
author = {Ziyi Xia and Kun Luo and Hongjin Qian and Zheng Liu},
journal= {arXiv preprint arXiv:2509.00375},
year = {2025}
}