基于多模态知识图谱的多模态推理
计算与语言
2024-06-06 v2 人工智能
摘要
使用大语言模型(LLM)进行多模态推理常常受到幻觉以及LLM内部知识缺失或过时的影响。一些方法试图通过使用文本知识图谱来缓解这些问题,但其单一的知识模态限制了全面的跨模态理解。在本文中,我们提出了基于多模态知识图谱的多模态推理(MR-MKG)方法,该方法利用多模态知识图谱(MMKG)学习跨模态的丰富语义知识,显著增强了LLM的多模态推理能力。具体而言,我们利用关系图注意力网络对MMKG进行编码,并设计了一个跨模态对齐模块来优化图像-文本对齐。我们构建了一个基于MMKG的数据集,通过预训练使LLM具备多模态推理的初步专业知识。值得注意的是,MR-MKG仅需训练LLM参数中极小的一部分(约2.25%)即可实现优越的性能。在多模态问答和多模态类比推理任务上的实验结果表明,我们的MR-MKG方法优于先前的最先进模型。
引用
@article{arxiv.2406.02030,
title = {Multimodal Reasoning with Multimodal Knowledge Graph},
author = {Junlin Lee and Yequan Wang and Jing Li and Min Zhang},
journal= {arXiv preprint arXiv:2406.02030},
year = {2024}
}
备注
Accepted by ACL 2024 (Main Conference)