基于LLM的可追溯知识图谱语句验证
人工智能
2025-06-12 v2 机器学习
摘要
本文提出了一种用于验证RDF三元组的方法,强调提供可追溯的论证。由于当前LLM无法可靠地识别用于构造对用户提示作出响应所需信息的来源,因此我们的方法是完全避免使用内部LLM事实知识。相反,通过Web搜索或Wikipedia检索到的外部文档块与已验证的RDF语句进行比较。为评估该检索增强生成(RAG)工作流程在生物学领域内容的可能应用,我们在BioRED数据集和相同数量的新生成负面语句上进行了评估。结果显示,精确率为88%,召回率为44%。这表明该方法需要人工监督。我们还在SNLI数据集上评估了该方法,这使我们能够将其方法与专为自然语言推理任务调谐的模型进行比较。在Wikidata上演示了该方法,其中使用SPARQL查询自动检索需要验证的语句。总体而言,结果表明LLM可用于大规模验证知识图中的语句,这以前由于人工标注成本而不可行。
引用
@article{arxiv.2409.07507,
title = {Traceable LLM-based validation of statements in knowledge graphs},
author = {Daniel Adam and Tomáš Kliegr},
journal= {arXiv preprint arXiv:2409.07507},
year = {2025}
}