中文

视觉谜题: 大型视觉和语言模型的常识与世界知识挑战

计算机视觉与模式识别 2024-11-26 v2 计算与语言

摘要

想象一下观察到有人在抓抓手臂;要理解原因,还需要额外的背景信息。然而,如果看到靠近的蚊子,就会立即提供对该人不适原因的可能解释,从而消除了进一步信息的需求。这一例子说明了细微的视觉线索如何挑战我们的认知能力,并显示了解释视觉情景的复杂性。为了研究这些能力,我们提出了视觉谜题 (Visual Riddles),这是一个旨在测试视觉和语言模型在视觉谜题中运用常识和世界知识的基准。该基准包含 400 个视觉谜题,每个谜题都包含独特的图像、问题、ground-truth答案、文本提示和归因。人类评估显示,现有模型在性能上显著落后于人类水平,人类准确率为 82%,而 Gemini-Pro-1.5 以 40% 的准确率领先。我们的基准附带自动评估任务,以便实现可扩展的评估。我们的发现凸显了视觉谜题作为提升视觉和语言模型在解释复杂视觉情景方面能力的宝贵资源的潜力。

关键词

引用

@article{arxiv.2407.19474,
  title  = {Visual Riddles: a Commonsense and World Knowledge Challenge for Large Vision and Language Models},
  author = {Nitzan Bitton-Guetta and Aviv Slobodkin and Aviya Maimon and Eliya Habba and Royi Rassin and Yonatan Bitton and Idan Szpektor and Amir Globerson and Yuval Elovici},
  journal= {arXiv preprint arXiv:2407.19474},
  year   = {2024}
}

备注

https://visual-riddles.github.io/