中文

使用大型语言模型进行端到端数据集成

计算与语言 2026-03-12 v1

摘要

设计数据集成管道通常需要数据工程师大量的手动工作来配置管道组件并标记训练数据。虽然大型语言模型(LLM)在处理集成过程的各个步骤方面显示出前景,但其是否有能力完全取代端到端数据集成管道中的所有人类输入尚未被调查。为了探索这一潜力,本文提出了一个自动数据集成管道,该管道使用 GPT-5.2 生成适用于特定用例的所有必需制品。这些制品包括模式映射、用于数据规范化的值映射、用于实体匹配的训练数据,以及用于选择数据融合中冲突解决启发方法的验证数据。我们将该基于 LLM 的管道性能与人类设计的管道性能进行比较,沿用三个案例研究,涉及视频游戏、音乐和公司相关数据的集成。我们的实验表明,基于 LLM 的管道能够产生与人类设计的管道相似的效果,部分任务甚至更好。从端面来看,人类和 LLM 管道生产的集成数据集大小和密度相当。让 LLM 配置管道的成本约为每个案例研究 10 美元,仅为人类数据工程师执行相同任务成本的一个小比例。

关键词

引用

@article{arxiv.2603.10547,
  title  = {Automatic End-to-End Data Integration using Large Language Models},
  author = {Aaron Steiner and Christian Bizer},
  journal= {arXiv preprint arXiv:2603.10547},
  year   = {2026}
}

备注

8 pages, 9 tables. Accepted at the Beyond SQL Workshop at ICDE 2026