中文

VAT-KG:面向检索增强生成的视觉-音频-文本多模态知识图谱数据集

计算与语言 2025-09-29 v3

摘要

多模态知识图谱(MMKGs)通过补充多模态大型语言模型(MLLMs)所蕴含的知识,使其能够通过检索增强生成实现更有依据的推理。然而,现有的 MMKGs 通常在范围上受限:它们往往通过扩充既有知识图谱来构建,这限制了其知识,导致知识覆盖过时或不完整,同时通常只支持有限的模态范围,如文本和视觉信息。这些限制限制了对多模态任务的适用性,尤其是由于最近的 MLLMs 采用更丰富的模态,如视频和音频。因此,我们提出了 Visual-Audio-Text 知识图谱(VAT-KG),这是第一个以概念为中心且知识密集型的多模态知识图谱,覆盖视觉、音频和文本信息,其中每个三元组都链接到多模态数据并附有概念的详细描述。具体而言,我们的构建管道通过一系列严格的过滤和对齐步骤,确保多模态数据与细粒度语义之间的跨模态知识对齐,从而实现从任意多模态数据集自动生成 MMKGs。我们进一步引入了一种新型的多模态 RAG 框架,用于响应来自任意模态的查询检索详细的概念级知识。在各种模态上的问答任务实验表明,VAT-KG 在支持 MLLMs 方面有效,凸显了其在统一和利用多模态知识方面的实际价值。

关键词

引用

@article{arxiv.2506.21556,
  title  = {VAT-KG: Knowledge-Intensive Multimodal Knowledge Graph Dataset for Retrieval-Augmented Generation},
  author = {Hyeongcheol Park and Jiyoung Seo and MinHyuk Jang and Hogun Park and Ha Dam Baek and Gyusam Chang and Hyeonsoo Im and Sangpil Kim},
  journal= {arXiv preprint arXiv:2506.21556},
  year   = {2025}
}

备注

Project Page: https://vatkg.github.io/