中文

PuzzleVQA: 利用抽象视觉模式诊断语言模型的多模态推理挑战

计算机视觉与模式识别 2024-08-20 v3

摘要

大型多模态模型通过整合多模态理解能力,扩展了大型语言模型的强大功能。然而,它们如何模拟人类的通用智能和推理能力尚不清楚。由于识别模式和抽象概念是通用智能的关键,我们引入了PuzzleVQA,一个基于抽象模式的2000个谜题实例集合。利用这个数据集,我们基于基本概念(包括颜色、数字、大小和形状)评估了大型多模态模型处理抽象模式的能力。通过对最先进的大型多模态模型进行实验,我们发现它们无法很好地泛化到简单的抽象模式。值得注意的是,GPT-4V在单概念谜题上的得分为46.4%,这表明最先进的模型在我们的数据集上表现不佳。为了诊断大型多模态模型中的推理挑战,我们使用视觉感知、归纳推理和演绎推理的真实推理解释逐步引导模型。我们的系统分析发现,GPT-4V的主要瓶颈在于较弱的视觉感知和归纳推理能力。通过这项工作,我们希望揭示大型多模态模型的局限性,以及它们未来如何更好地模拟人类的认知过程。我们的数据和代码可在 https://puzzlevqa.github.io 获取。

关键词

引用

@article{arxiv.2403.13315,
  title  = {PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns},
  author = {Yew Ken Chia and Vernon Toh Yan Han and Deepanway Ghosal and Lidong Bing and Soujanya Poria},
  journal= {arXiv preprint arXiv:2403.13315},
  year   = {2024}
}

备注

ACL 2024 Camera Ready