中文

它们相同吗?探究多模态大语言模型的视觉对应缺陷

计算机视觉与模式识别 2025-07-10 v3

摘要

最近多模态大语言模型(MLLM)在视觉感知、推理能力和视觉语言理解方面展现出强大能力。然而,尽管寻找物体的视觉对应是计算机视觉中的基本问题,MLLM的视觉匹配能力却鲜有研究。我们的研究揭示,即使是当前强大的MLLM模型GPT-4o,其匹配能力仍存在系统性缺陷。具体而言,我们构建了一个多模态视觉匹配(MMVM)基准,以公平地评估超过30种不同的MLLM。MMVM基准由15个开源数据集和互联网视频经人工标注构建而成。我们将MMVM基准的数据样本根据所需线索和能力分为八个方面,以更全面地评估和分析当前MLLM。此外,我们设计了一个自动标注流水线,生成了包含22万条视觉匹配数据及推理标注的MMVM SFT数据集。据我们所知,这是MLLM社区首个视觉对应数据集和基准。最后,我们提出了CoLVA,一种新颖的对比式MLLM,包含两项新技术设计:具有对象级对比学习的细粒度视觉专家和指令增强策略。前者学习实例判别性标记,后者进一步提高了指令遵循能力。CoLVA-InternVL2-4B在MMVM基准上达到了49.80%的总体准确率(OA),分别超过GPT-4o和最佳开源MLLM Qwen2VL-72B 7.15%和11.72%的OA。这些结果证明了我们的MMVM SFT数据集和新颖技术设计的有效性。代码、基准、数据集和模型将公开发布。

关键词

引用

@article{arxiv.2501.04670,
  title  = {Are They the Same? Exploring Visual Correspondence Shortcomings of Multimodal LLMs},
  author = {Yikang Zhou and Tao Zhang and Shilin Xu and Shihao Chen and Qianyu Zhou and Yunhai Tong and Shunping Ji and Jiangning Zhang and Lu Qi and Xiangtai Li},
  journal= {arXiv preprint arXiv:2501.04670},
  year   = {2025}
}

备注

Accepted by ICCV2025