用于更新新兴文本知识图谱的 EMERGE:一个基准
计算与语言
2026-04-08 v2
摘要
知识图谱 (KG) 是包含实体及其之间的关系的结构化知识存储库。本文我们研究了根据不可结构化文本源中演化的知识,自动更新 KG 时间序列的问题。解决这一问题需要基于给定时间点下现有 KG 状态和从文本中提取的信息,识别各种更新操作。这与传统信息抽取管道不同后者独立于 KG 当前状态从文本中抽取知识。为解决这一挑战,我们提出了构建由 Wikidata KG 时间序列快照和与之配对的 Wikipedia 章节组成的数据集的方法,这些章节对应于特定 KG 快照中产生的编辑操作。 resulting dataset 包含 233K 个 Wikipedia 章节,aligned with 总计 145 万次 KG 编辑,覆盖 2019 年至 2025 年的 7 个年度 Wikidata 快照。我们的实验结果突显了基于新兴文本知识更新 KG 快照的关键挑战,特别是在将文本中表达的知识与现有 KG 结构集成方面的挑战。这些发现将该数据集定位为未来研究的宝贵基准。我们的 dataset 和模型实现均公开可用。
引用
@article{arxiv.2507.03617,
title = {EMERGE: A Benchmark for Updating Knowledge Graphs with Emerging Textual Knowledge},
author = {Klim Zaporojets and Daniel Daza and Edoardo Barba and Ira Assent and Roberto Navigli and Paul Groth},
journal= {arXiv preprint arXiv:2507.03617},
year = {2026}
}