中文

ScIRGen: 用于科学研究的真实且大规模 RAG 数据集合成框架

计算与语言 2025-06-16 v1 人工智能 信息检索

摘要

科学研究者需要深入的信息才能有效评估和发展理论与方法论。关于数据集的信息需求在特定研究任务中被隐式嵌入,而非在搜索查询中显式表达。然而,现有的科学检索和问答(QA)数据集通常针对 straightforward 的问题,无法符合现实世界研究询求的分布。为弥合这一差距,我们开发了 ScIRGen,这是一个面向科学 QA 与检索的数据集生成框架,更准确地反映专业科学研究者的信息需求,并用于创建规模庞大的科学检索增强生成(RAG)数据集,包含真实的查询、数据集和论文。在技术方面,我们设计了一种以数据集为导向的信息提取方法,利用学术论文来增强数据集表征。随后,我们提出了一种问生成框架,通过运用认知分类学确保合成问题的质量。我们还设计了一种方法,基于 LLM 的困惑度偏移自动过滤合成答案,该方法高度符合人类对答案有效性的判断。综合这些方法,我们创建了包含61k个 QA 条目的 ScIRGen-Geo 数据集。我们在 ScIRGen-Geo 数据集上对代表性方法进行基准测试,评估其问答和检索能力,发现当前方法在处理复杂问题时仍存在推理不足的问题。本工作推动了开发更为精细化的工具,以支持科学界复杂的信息需求。

关键词

引用

@article{arxiv.2506.11117,
  title  = {ScIRGen: Synthesize Realistic and Large-Scale RAG Dataset for Scientific Research},
  author = {Junyong Lin and Lu Dai and Ruiqian Han and Yijie Sui and Ruilin Wang and Xingliang Sun and Qinglin Wu and Min Feng and Hao Liu and Hui Xiong},
  journal= {arXiv preprint arXiv:2506.11117},
  year   = {2025}
}

备注

KDD 2025 Accepted