中文

iText2KG:使用大语言模型增量构建知识图谱

人工智能 2024-09-06 v1 计算与语言 信息检索

摘要

大多数可用数据是非结构化的,这使得获取有价值的信息具有挑战性。自动构建知识图谱(KGs)对于结构化数据并使其可访问至关重要,允许用户有效地搜索信息。知识图谱还促进了洞察、推断和推理。传统的 NLP 方法,如命名实体识别和关系抽取,在信息检索中起关键作用,但面临局限性,包括使用预定义的实体类型和需要监督学习。当前研究利用大语言模型的能力,如零样本或少样本学习。然而,未解决和语义重复的实体和关系仍然构成挑战,导致图谱不一致并需要大量的后处理。此外,大多数方法依赖于特定主题。在本文中,我们提出 iText2KG,一种无需后处理的增量式、主题无关的知识图谱构建方法。这种即插即用的零样本方法适用于广泛的 KG 构建场景,包含四个模块:文档蒸馏器、增量实体提取器、增量关系提取器和图谱集成与可视化。我们的方法在三个场景中表现出优于基线方法的性能:将科学论文转换为图谱、网站转换为图谱和简历转换为图谱。

关键词

引用

@article{arxiv.2409.03284,
  title  = {iText2KG: Incremental Knowledge Graphs Construction Using Large Language Models},
  author = {Yassir Lairgi and Ludovic Moncla and Rémy Cazabet and Khalid Benabdeslem and Pierre Cléau},
  journal= {arXiv preprint arXiv:2409.03284},
  year   = {2024}
}

备注

Accepted at The International Web Information Systems Engineering conference (the WISE conference) 2024