驭服未驭之兽:基于图的多模态大语言模型知识检索与推理
人工智能
2025-08-26 v3
摘要
知识的真正价值不在于其积累,而在于其被有效利用以征服未知。尽管最近的多模态大语言模型(MLLMs)展现出令人印象的多模态能力,但在因知识有限而难以应对的少见领域任务时仍常常失败。为探索这一问题,我们采用视觉游戏认知作为测试平台,选取《怪物猎人:世界》作为目标构建多模态知识图谱(MH-MMKG),该图谱包含多模态特征和复杂的实体关系。我们还设计了一系列基于 MH-MMKG 的挑战性查询,以评估模型在复杂知识检索与推理方面的能力。进一步地,我们提出了一种多智能体检索器,使模型能够在无需额外训练的情况下自主搜索相关知识。实验结果表明,我们的方法显著提升了 MLLMs 的性能,为多模态知识增强推理提供了新视角,并为未来研究奠定了坚实的基础。
引用
@article{arxiv.2506.17589,
title = {Taming the Untamed: Graph-Based Knowledge Retrieval and Reasoning for MLLMs to Conquer the Unknown},
author = {Bowen Wang and Zhouqiang Jiang and Yasuaki Susumu and Shotaro Miwa and Tianwei Chen and Yuta Nakashima},
journal= {arXiv preprint arXiv:2506.17589},
year = {2025}
}
备注
Aligned with ICCV 2025 camera-ready version