BLINK:多模态大语言模型能看见但无法感知
计算机视觉与模式识别
2024-07-04 v4 人工智能
计算与语言
摘要
我们提出了Blink,一个针对多模态大语言模型(LLM)的新基准,专注于其他评估中没有的核心视觉感知能力。Blink的大部分任务人类“眨眼间”即可解决(例如,相对深度估计、视觉对应、取证检测和多视图推理)。然而,我们发现这些高感知需求的任务对当前多模态LLM构成了重大挑战,因为它们难以通过自然语言进行中介。Blink将14个经典计算机视觉任务重新格式化为3,807道多项选择题,配有单张或多张图像及视觉提示。人类平均准确率达到95.70%,而Blink对现有的多模态LLM却具有出人意料的挑战性:即使是表现最好的GPT-4V和Gemini,准确率也仅为51.26%和45.72%,仅比随机猜测高13.17%和7.63%,表明这种感知能力在近期的多模态LLM中尚未“涌现”。我们的分析还强调,专门的CV模型可以更好地解决这些问题,为未来的改进提供了潜在途径。我们相信Blink将激励社区帮助多模态LLM赶上人类水平的视觉感知。
引用
@article{arxiv.2404.12390,
title = {BLINK: Multimodal Large Language Models Can See but Not Perceive},
author = {Xingyu Fu and Yushi Hu and Bangzheng Li and Yu Feng and Haoyu Wang and Xudong Lin and Dan Roth and Noah A. Smith and Wei-Chiu Ma and Ranjay Krishna},
journal= {arXiv preprint arXiv:2404.12390},
year = {2024}
}
备注
Multimodal Benchmark, Project Url: https://zeyofu.github.io/blink/, ECCV 2024