睁一只眼闭一只眼?探索多模态大语言模型的视觉缺陷
计算机视觉与模式识别
2024-04-26 v2
摘要
视觉对语言来说足够好吗?多模态模型的最新进展主要源于大语言模型(LLMs)强大的推理能力。然而,其视觉组件通常仅依赖于实例级的对比语言-图像预训练(CLIP)。我们的研究揭示,当前多模态大语言模型(MLLMs)的视觉能力仍存在系统性缺陷。为理解这些错误的根源,我们探索了CLIP视觉嵌入空间与纯视觉自监督学习之间的差距。我们识别出“CLIP盲点对”——即CLIP认为相似但视觉差异明显的图像。利用这些图像对,我们构建了多模态视觉模式(MMVP)基准。MMVP暴露了包括GPT-4V在内的最先进系统在九个基本视觉模式上难以回答直接问题的领域,它们常常提供错误答案和幻觉解释。我们进一步评估了各种基于CLIP的视觉-语言模型,发现挑战CLIP模型的视觉模式与困扰多模态LLMs的模式之间存在显著相关性。作为解决这些问题的初步尝试,我们提出了一种特征混合(MoF)方法,证明将视觉自监督学习特征与MLLMs集成可以显著增强其视觉定位能力。总之,我们的研究表明视觉表征学习仍是一个开放挑战,准确的视觉定位对未来成功的多模态系统至关重要。
引用
@article{arxiv.2401.06209,
title = {Eyes Wide Shut? Exploring the Visual Shortcomings of Multimodal LLMs},
author = {Shengbang Tong and Zhuang Liu and Yuexiang Zhai and Yi Ma and Yann LeCun and Saining Xie},
journal= {arXiv preprint arXiv:2401.06209},
year = {2024}
}
备注
Project page: https://tsb0601.github.io/mmvp_blog/