多模态结构化知识的抽象视觉理解:MLLM 评估的新视角
计算机视觉与模式识别
2025-06-03 v1 人工智能
计算与语言
摘要
多模态大语言模型(MLLM)将异构模态融入 LLM,从而能够全面理解各种场景和对象。尽管针对 MLLM 的评估基准和排行榜日益增多,但它们主要忽略了 MLLM 理解以视觉形式出现的结构化抽象世界知识的关键能力。为弥补这一差距,我们提出了一种新颖的评估范式,并设计了 M3STR——一个基于结构化理解多模态地图(Multi-Modal Map for STRuctured understanding)的创新基准。该基准利用多模态知识图谱合成图像,这些图像封装了富含多模态实体的子图架构。M3STR 要求 MLLM 不仅要识别视觉输入中的多模态实体,还要破译它们之间复杂的关系拓扑。我们概述了该基准的统计特征和自动化构建流程,并对 26 个 SOTA MLLM 进行了广泛的实证分析。我们的发现揭示了在处理具有结构化知识的抽象视觉信息方面存在持续不足,从而为提升 MLLM 的整体推理能力规划了关键轨迹。我们的代码和数据已发布于 https://github.com/zjukg/M3STR
引用
@article{arxiv.2506.01293,
title = {Abstractive Visual Understanding of Multi-modal Structured Knowledge: A New Perspective for MLLM Evaluation},
author = {Yichi Zhang and Zhuo Chen and Lingbing Guo and Yajing Xu and Min Zhang and Wen Zhang and Huajun Chen},
journal= {arXiv preprint arXiv:2506.01293},
year = {2025}
}
备注
Work in progress