基于本体对的神经符号知识图构建:后提取校正中的时机优于即时
人工智能
2026-05-29 v1 机器学习
摘要
问答 (QA) 是 AI 中的核心挑战,尤其是对于需要跨文档进行多跳推理或诸如聚合或穷举列举等符号操作的复杂查询。 检索增强生成已成为 QA 的主导方法,近期的基于图的方法在一定程度上解决了这些问题,通过组织知识以更好地支持组合性问题。 然而,大多数基于文本的图式 RAG 方法仍缺乏足够的结构,以实现可靠回答复杂问题所需的符号操作。这促使采用符号图方法,即提取知识图 (KG),其关系为逻辑谓词,可支持 SQL 式查询。 然而,这类管道通常使用 LLM 进行 KG 提取,可能引入一致性问题,即提取的事实可能违反常识本体约束。 我们提出一种神经符号框架,用于本体导向的 KG 构建,结合开域提取、基于嵌入的类型和谓词规范化,以及针对本体违规的定向 LLM 校正。 通过将校正延迟到后提取阶段,我们的方法避免了重复调用 LLM,显著降低了 token 使用量,同时提高了 KG 的一致性并保持下游 QA 的质量。 最终,我们展示提取的 KG 适合进行符号查询,通过测量 SPARQL 图模式的出现情况来验证。
引用
@article{arxiv.2605.29168,
title = {Better Later Than Sooner: Neuro-Symbolic Knowledge Graph Construction via Ontology-grounded Post-extraction Correction},
author = {Lorenzo Loconte and Timothy Hospedales and Cristina Cornelio},
journal= {arXiv preprint arXiv:2605.29168},
year = {2026}
}