ODKE+:基于 LLM 的本体引导开放域知识抽取
计算与语言
2025-09-08 v1 人工智能
摘要
知识图谱(KGs)是许多 AI 应用的基础,但保持其时效性和完整性仍然成本高昂。我们提出 ODKE+,一个生产级系统,能够以高精度从网络来源自动抽取并摄取数百万个开放域事实。ODKE+ 将模块化组件结合为一个可扩展的流水线:(1)抽取启动器检测缺失或过时的事实;(2)证据检索器收集支持性文档;(3)混合知识抽取器同时应用基于模式的规则和面向大语言模型(LLMs)的本体引导提示;(4)轻量级 Grounding 验证器使用第二个 LLM 验证抽取的事实;(5)确证器对候选事实进行排序和归一化以供摄取。ODKE+ 动态生成针对每种实体类型定制的本体片段,以使抽取与模式约束对齐,从而实现跨 195 个谓词的可扩展、类型一致的事实抽取。该系统支持批处理和流处理模式,处理了超过 900 万个 Wikipedia 页面,并以 98.8% 的精度摄取了 1900 万个高置信度事实。ODKE+ 显著提高了相较于传统方法的覆盖率,与第三方知识图谱实现了高达 48% 的重叠,并将更新延迟平均减少了 50 天。我们的部署表明,基于本体结构和验证工作流的 LLM 抽取,能够提供值得信赖的、生产级规模的知识摄取,并具有广泛的现实世界适用性。提交材料中包含系统演示的录像,也可在 https://youtu.be/UcnE3_GsTWs 获取。
引用
@article{arxiv.2509.04696,
title = {ODKE+: Ontology-Guided Open-Domain Knowledge Extraction with LLMs},
author = {Samira Khorshidi and Azadeh Nikfarjam and Suprita Shankar and Yisi Sang and Yash Govind and Hyun Jang and Ali Kasgari and Alexis McClimans and Mohamed Soliman and Vishnu Konda and Ahmed Fakhry and Xiaoguang Qi},
journal= {arXiv preprint arXiv:2509.04696},
year = {2025}
}