中文

MARVEL:多维抽象与视觉评估与学习

计算机视觉与模式识别 2024-04-26 v2 机器学习

摘要

虽然多模态大语言模型(MLLM)在许多流行的视觉推理基准测试上取得了显著进展,但它们是否具备抽象视觉推理能力仍是一个未解决的问题。类似数独谜题,抽象视觉推理(AVR)问题需要找到控制特定任务配置中输入图形(如数字)的高级模式(如重复约束)。然而,现有的AVR基准仅考虑了有限的模式(加法、合取)、输入图形(矩形、正方形)和任务配置(3×3矩阵)。为全面评估MLLM的推理能力,我们引入MARVEL,一个包含770个谜题的多维AVR基准,涵盖六个核心知识模式、几何与抽象图形,以及五种不同的任务配置。为检查模型准确率是否基于感知与推理,MARVEL补充了感知问题,构建了分层评估框架。我们在零-shot和few-shot设置下对MARVEL上的九个代表性MLLM进行了全面实验。我们的实验显示,所有模型在AVR问题上表现接近随机,在所有模式和任务配置上与人类相差约40%。进一步分析感知问题的结果发现,MLLM在理解视觉特征(接近随机)和计数谜题面板数(<45%)方面困难重重,阻碍了其抽象推理能力。我们发布了全部代码和数据集。

关键词

引用

@article{arxiv.2404.13591,
  title  = {MARVEL: Multidimensional Abstraction and Reasoning through Visual Evaluation and Learning},
  author = {Yifan Jiang and Jiarui Zhang and Kexuan Sun and Zhivar Sourati and Kian Ahrabian and Kaixin Ma and Filip Ilievski and Jay Pujara},
  journal= {arXiv preprint arXiv:2404.13591},
  year   = {2024}
}