基于循环评估构建知识图谱-文本配对数据集
计算与语言
2023-09-22 v1
摘要
将知识图谱(KG)与文本配对(KG-T)的数据集可用于训练从 KG 生成文本及反之的前向与反向神经模型。然而,在 KG 与文本对不等价的数据集上训练的模型可能出现更多幻觉且召回率更低。本文中,我们通过生成具有不同噪声水平的数据集对这一经验现象进行验证,发现噪声更大的数据集确实导致更多幻觉。我们认为,在某一数据集上训练的前向与反向模型循环再生源 KG 或文本的能力,可作为数据集中 KG 与文本等价性的代理指标。利用循环评估,我们发现人工创建的 WebNLG 远优于自动创建的 TeKGen 和 T-REx。受这些观察指导,我们构建了一个名为 LAGRANGE 的改进新数据集,采用旨在提升 KG 与文本等价性的启发式方法,并展示了各启发式方法对循环评估的影响。我们还利用大语言模型(LLM)构建了两个合成数据集,观察到这些数据集有助于在文本循环生成上表现极佳的模型,但在 KG 循环生成上表现较差,可能源于缺乏一致的基础本体。
引用
@article{arxiv.2309.11669,
title = {Construction of Paired Knowledge Graph-Text Datasets Informed by Cyclic Evaluation},
author = {Ali Mousavi and Xin Zhan and He Bai and Peng Shi and Theo Rekatsinas and Benjamin Han and Yunyao Li and Jeff Pound and Josh Susskind and Natalie Schluter and Ihab Ilyas and Navdeep Jaitly},
journal= {arXiv preprint arXiv:2309.11669},
year = {2023}
}
备注
16 pages