中文

基于语言模型和视觉模型的多模态文化遗产知识图谱扩展

人工智能 2026-05-19 v1

摘要

文化遗产的保存与解读日益依赖数字技术,其中知识图谱(KG)凭借其结构化大规模数据的能力而居于一方。然而,由于文化遗产信息的多样性和复杂性,构建和扩展这些知识图谱常面临挑战。本文提出了一种用于扩展文化遗产领域KG资源的新方法,已应用于法国数据。首先,我们引入了新的法国文化遗产知识图谱WJoconde,其独特之处在于其多模态特性,即集成了实体的文本和图像信息。我们进一步引入了WJoconde的三个变体,以便于下游研究,如知识图谱完成(KGC)。我们还构建了针对该数据集上KGC方法的全面基准。其次,我们提出了一种利用大语言模型(LLM)和视觉语言模型(VLM)的多模态方法以扩展文化遗产知识图谱的新框架,该框架包括从非结构化资源中自动提取数据并结合两种模型输出的特殊验证管道,以进一步扩展WJoconde。我们的结果表明,通过整合文化遗产数据的丰富文本和图像信息,我们可以高效可靠地增强知识图谱。我们开源了所有代码和基准数据集(包含文本和图像),以及具有交互式访问入口的原始数据。

关键词

引用

@article{arxiv.2605.17669,
  title  = {Multimodal Cultural Heritage Knowledge Graph Extension with Language and Vision Models},
  author = {Yang Zhang and Nada Mimouni and Jean-Claude Moissinac and Fayçal Hamdi},
  journal= {arXiv preprint arXiv:2605.17669},
  year   = {2026}
}