中文

DPDisc:从事实类问题到数据产品请求,用于表格和文本上的开放世界数据产品发现

信息检索 2026-03-19 v4

摘要

数据产品是为特定业务用例设计的、可重用且自包含的资产。自动化其发现对于工业界尤为重要,因为这可以高效地在大型数据湖中获取数据,并支持分析工作流程。然而,目前尚无针对混合表格-文本语料库的数据产品发现基准。现有数据集专注于回答针对单个表格的单一事实类问题,而非将多个相关数据资产组装成连贯的数据产品。为此,我们提出 DPDisc,首个大规模数据产品发现基准,系统需检索满足高级数据产品请求 (DPR) 的连贯表格和段落集合。我们引入 DPForge,一个自动化管道,系统性地将表格-QA 数据集中相关表格和段落聚类为连贯的数据产品,使用 LLM 组合生成专业水平的分析请求,并通过多阶段 LLM 评估验证质量。DPDisc 包含 13,076 个经验证的实例,具有完整的来源信息,源自覆盖开放领域和金融领域的三个典型数据集。基线实验使用稀疏、稠密和混合检索方法表明评估可行性,同时揭示了不同领域间的显著性能差距,表明结构感知的数据产品发现仍有潜在研究机会。代码和数据集均可在 Dataset: https://huggingface.co/datasets/ibm-research/data-product-benchmark Code: https://github.com/ibm/data-product-benchmark 访问。

关键词

引用

@article{arxiv.2510.21737,
  title  = {DPDisc: From Factoid Questions to Data Product Requests for Open-World Data Product Discovery over Tables and Text},
  author = {Liangliang Zhang and Nandana Mihindukulasooriya and Niharika S. D'Souza and Sola Shirai and Sarthak Dash and Yao Ma and Horst Samulowitz},
  journal= {arXiv preprint arXiv:2510.21737},
  year   = {2026}
}

备注

15 pages, 4 figure, 7 tables