中文

M^2ConceptBase:细粒度对齐的以概念为中心的多模态知识库

人工智能 2025-01-27 v3

摘要

多模态知识库(MMKB)提供了对多模态任务至关重要的跨模态对齐知识。然而,现有 MMKB 中的图像通常是为百科全书知识图谱中的实体收集的。因此,缺乏视觉语义与语言概念的详细对应,而这对于多模态模型的视觉概念认知能力是必不可少的。针对这一空白,本文引入了首个以概念为中心的 MMKB——M^2ConceptBase。M^2ConceptBase 将概念建模为节点,并关联图像和详细的文本描述。本文提出了一种上下文感知的多模态符号接地方法,利用图像文本数据集中的上下文信息对齐概念-图像和概念-描述对。M^2ConceptBase 包含 951K 张图像和 152K 个概念,将每个概念平均关联至 6.27 张图像和一条描述,确保了全面的视觉和文本语义。人类研究证实其对齐准确率超过 95%,凸显了其质量。此外,实验表明,M^2ConceptBase 显著提升了 VQA 模型在 OK-VQA 任务上的性能。通过在两个概念相关任务中的检索增强,M^2ConceptBase 还大幅提升了多模态大语言模型的细粒度概念理解能力,彰显了其价值。

关键词

引用

@article{arxiv.2312.10417,
  title  = {M^2ConceptBase: A Fine-Grained Aligned Concept-Centric Multimodal Knowledge Base},
  author = {Zhiwei Zha and Jiaan Wang and Zhixu Li and Xiangru Zhu and Wei Song and Yanghua Xiao},
  journal= {arXiv preprint arXiv:2312.10417},
  year   = {2025}
}

备注

Accepted by CIKM2024. The code and data can be found at https://github.com/AwellmanZha/M2ConceptBase