用于间隔与重叠分析的基准测试:知识图谱任务就绪性的测试
人工智能
2026-04-14 v1
摘要
任务导向的知识图谱(KG)质量评估日益要求,是否可以以可重复、可解释且可追溯至证据的方式回答用户真正关心的 competency questions。本文采纳了这种视角,聚焦于政策类文档(如保险合同)的间隔与重叠分析:给定情景,哪些文档支持该情景(重叠)哪些不支持(间隔),并附有可辩护的依据。由于间隔/重叠判断通常由覆盖范围和限制的真实差异驱动,而非数据缺失,这一任务实际上是 KG 任务就绪性的直接测试,而非缺失事实或查询表达性的测试。我们呈现了一个可执行且可审计的基准测试,将自然语言合同文本与形式本体对齐,并连接证据链接的ground truth,实现方法的系统比较。基准测试包括:(i)十个简化且多样化的寿险合同,由领域专家审核;(ii)一个域本体(TBox)与从合同事实中填充的实例知识库(ABox);(iii)58个结构化情景配对 SPARQL 查询,合同级别的结果和条款级别的摘录用于支撑每个标签。使用该资源,我们将仅基于文本的 LLM 基线与基于实例化 KG 的本体驱动管道进行比较,后者在同一情景上作答,显示显式建模在一致性和诊断方面具有优势。虽然以间隔与重叠分析为演示,但该基准旨作为评估 KG 质量并支持下游任务(如本体学习、KG 填充和证据导向问答)的可重用模板。
引用
@article{arxiv.2604.10853,
title = {A Benchmark for Gap and Overlap Analysis as a Test of KG Task Readiness},
author = {Maruf Ahmed Mridul and Rohit Kapa and Oshani Seneviratne},
journal= {arXiv preprint arXiv:2604.10853},
year = {2026}
}