中文

通过合成数据生成与蒸馏扩展知识图谱构建规模

计算与语言 2026-03-03 v2 信息检索

摘要

文档级知识图谱(KG)构建面临根本性的规模挑战:现有方法要么依赖高成本的大型语言模型(LLM),在大规模语料库上经济上不可行,要么采用较小的模型produce不完整且不一致的图谱。我们发现,这一限制并非源于模型能力本身,而是源于对高质量文档级KG数据的训练不足。为此,我们引入SynthKG,一个多步骤数据合成管道,通过系统化的分块、去语境化和结构化提取使用LLM生成高质量的文档-KG配对。通过在合成文档-KG配对上微调较小的LLM,我们将多步骤过程简化为单步骤KG生成方法,称为Distill-SynthKG。此外,我们重新利用现有的问答数据集构建KG评估数据集,并引入新的评估指标。使用Distill-SynthKG生成的KGs,我们还设计了一种新颖的基于图检索框架用于RAG。实验结果表明,Distill-SynthKG不仅在KG质量方面超越所有基线模型(包括规模可达八倍的模型),在检索和问答任务中也持续获得改进。此外,我们提出的图检索框架在多个基准数据集上均优于所有KG检索方法。

关键词

引用

@article{arxiv.2410.16597,
  title  = {Scaling Knowledge Graph Construction through Synthetic Data Generation and Distillation},
  author = {Prafulla Kumar Choubey and Xin Su and Man Luo and Xiangyu Peng and Caiming Xiong and Tiep Le and Shachar Rosenman and Vasudev Lal and Phil Mui and Ricky Ho and Phillip Howard and Chien-Sheng Wu},
  journal= {arXiv preprint arXiv:2410.16597},
  year   = {2026}
}