中文

MMCOMPOSITION:重新审视预训练视觉语言模型的组合性

计算机视觉与模式识别 2024-10-15 v1

摘要

大型视觉语言模型(VLMs)的出现显著推动了多模态理解的发展,使能够在各种任务中实现更为精细和准确的视觉和文本信息的集成,包括图像和视频描述、视觉问答和跨模态检索。尽管VLMs具有出色的能力,但研究者对其组合性缺乏全面理解——即理解和生成已知视觉和文本组件的新型组合的能力。以前的基准仅从对象、关系和属性等角度提供了相对粗略的组合性评估,忽略了对对象交互、计数和复杂组合的深层推理。然而,组合性是VLMs实现跨模态协同推理和理解的关键能力。为解决这一局限,我们提出了MMCOMPOSITION,一个新颖的人工标注基准,用于全面和准确评估VLMs的组合性。我们提出的基准作为这些早期工作的补充。通过MMCOMPOSITION,我们可以量化和探索主流VLMs的组合性。令人惊讶的是,我们发现GPT-4o的组合性优于最佳开源模型,并分析了其背后的原因。我们的实验分析揭示了VLMs在细粒度组合感知和推理方面的局限性,并指向VLMs设计和训练的改进方向。资源请访问:https://hanghuacs.github.io/MMComposition/

关键词

引用

@article{arxiv.2410.09733,
  title  = {MMCOMPOSITION: Revisiting the Compositionality of Pre-trained Vision-Language Models},
  author = {Hang Hua and Yunlong Tang and Ziyun Zeng and Liangliang Cao and Zhengyuan Yang and Hangfeng He and Chenliang Xu and Jiebo Luo},
  journal= {arXiv preprint arXiv:2410.09733},
  year   = {2024}
}

备注

21 pages, 15 figures