无需本体知识的通用领域知识图谱到文本生成数据集合成
计算与语言
2024-09-12 v1 人工智能
摘要
知识图谱到文本 (G2T) 生成涉及将结构化知识图谱 verbalize 为自然语言文本。近期的预训练语言模型 (PLM) 进展提升了 G2T 性能,但其有效性取决于具有精确图-文本对齐的数据集。然而,稀缺的高质量、通用领域 G2T 生成数据集限制了通用领域 G2T 生成研究的进展。为此,我们引入了基于大型语言模型 (LLM) 和 Data-QuestEval 的无本体知识图谱-文本数据集合成方法,构建了维基百科无本体知识图谱数据集 (WikiOFGraph),该数据集包含 585 万组通用领域图-文本对,无需依赖外部本体即可实现高质量的图-文本一致性。实验结果表明,针对 WikiOFGraph 微调的 PLM 在各种评估指标上均优于其他数据集训练的模型。我们的方法证明是一种可扩展且高效的高质量 G2T 数据生成解决方案,显著推动了 G2T 生成领域的发展。
引用
@article{arxiv.2409.07088,
title = {Ontology-Free General-Domain Knowledge Graph-to-Text Generation Dataset Synthesis using Large Language Model},
author = {Daehee Kim and Deokhyung Kang and Sangwon Ryu and Gary Geunbae Lee},
journal= {arXiv preprint arXiv:2409.07088},
year = {2024}
}
备注
18 pages, 9 figures