中文

VOILA:面向感知理解与类比推理的多模态大语言模型评估

计算机视觉与模式识别 2026-02-26 v2 人工智能 计算与语言

摘要

多模态大语言模型(MLLMs)已成为整合视觉与文本信息的强大工具。尽管它们在视觉理解基准测试上表现卓越,但衡量其跨多张图像进行抽象推理的能力仍然是一个重大挑战。为此,我们引入了 VOILA,一个大规模、开放式、动态的基准测试,旨在评估 MLLMs 的感知理解和抽象关系推理能力。VOILA 在视觉领域采用类比映射方法,要求模型生成一张图像来完成给定两对图像(参考对和应用对)之间的类比,而不依赖于预定义选项。我们的实验表明,VOILA 中的类比推理任务对 MLLMs 构成了挑战。通过多步分析,我们揭示了当前的 MLLMs 难以理解图像间关系,并且在高层关系推理方面能力有限。值得注意的是,我们观察到,当遵循从最少到最多的逐步提示策略时,性能有所提高。对开源模型和 GPT-4o 的综合评估显示,在基于文本的答案上,挑战性场景的最高准确率为 13%(LLaMa 3.2),即使对于较简单的任务也仅为 29%(GPT-4o),而人类表现在两个难度级别上均显著更高,达到 70%。

关键词

引用

@article{arxiv.2503.00043,
  title  = {VOILA: Evaluation of MLLMs For Perceptual Understanding and Analogical Reasoning},
  author = {Nilay Yilmaz and Maitreya Patel and Yiran Lawrence Luo and Tejas Gokhale and Chitta Baral and Suren Jayasuriya and Yezhou Yang},
  journal= {arXiv preprint arXiv:2503.00043},
  year   = {2026}
}

备注

Accepted at ICLR 2025. Code and data: https://github.com/nlylmz/Voila