中文

ProVe:面向文本来源的知识图谱自动化溯源验证流水线

计算与语言 2022-10-27 v1

摘要

知识图谱是以语义三元组形式从众多领域和来源收集数据的信息库,在现代网络环境中作为从 Wikipedia 信息框到搜索引擎等各种关键应用的结构化数据源。此类图谱主要作为信息的二级来源,依赖于有据可查且可验证的溯源以确保其可信度和可用性。然而,它们系统评估和保证此溯源质量的能力,最关键的是它是否正确支持图谱信息,主要依赖于无法随规模扩展的手动过程。ProVe 旨在解决此问题,它由一种流水线方法组成,可自动验证知识图谱三元组是否由从其记录溯源中提取的文本所支持。ProVe 旨在协助信息策展人,由涉及基于规则的方法和机器学习模型的四个主要步骤组成:文本提取、三元组语言化、句子选择和声明验证。ProVe 在 Wikidata 数据集上进行了评估,总体取得了有希望的结果,并在检测溯源支持的二元分类任务中表现出色,在富文本来源上达到了 87.5% 的准确率和 82.9% 的 F1-macro。本文使用的评估数据和脚本可在 GitHub 和 Figshare 上获取。

关键词

引用

@article{arxiv.2210.14846,
  title  = {ProVe: A Pipeline for Automated Provenance Verification of Knowledge Graphs against Textual Sources},
  author = {Gabriel Amaral and Odinaldo Rodrigues and Elena Simperl},
  journal= {arXiv preprint arXiv:2210.14846},
  year   = {2022}
}