中文

Auto-Comp:面向对比式视觉语言模型的可扩展组合性探测的自动化管道

计算机视觉与模式识别 2026-02-03 v1 人工智能

摘要

现代视觉语言模型(VLM)在组合推理方面存在关键缺陷,常将"a red cube and a blue sphere"与"a blue cube and a red sphere"混淆。从视觉与语言根源上解析这些错误是健全评估的根本挑战。为实现细粒度、可控的分析,我们引入Auto-Comp,这是一个用于生成可扩展基准的全自动合成管道。其可控性是解构并隔离不同推理技能的关键。Auto-Comp从最小化描述(如"a monitor to the left of a bicycle on a white background")和LLM生成的情境描述(如"In a brightly lit photography studio, a monitor is positioned to the left of a bicycle")生成配对图像,允许进行受控的A/B测试,以解构核心绑定能力与视觉语言复杂性。我们对20个VLM在新建基准上的评估显示,CLIP和SigLIP模型族在颜色绑定和空间关系方面普遍存在组合性失败。关键的是,我们提出的新"混淆基准"揭示了超越简单属性置换的更深层缺陷:模型对低熵干扰因子(如重复的物体或颜色)高度敏感,表明其组合性失败超出了已知的基于词袋的局限。我们发现了一种惊人权衡:视觉语言情境提供全局场景线索,有助于空间推理,同时通过引入视觉杂乱同时阻碍局部属性绑定。我们发布Auto-Comp管道以促进未来基准的创建,并随所有生成的基准一起发布(https://huggingface.co/AutoComp)。

关键词

引用

@article{arxiv.2602.02043,
  title  = {Auto-Comp: An Automated Pipeline for Scalable Compositional Probing of Contrastive Vision-Language Models},
  author = {Cristian Sbrolli and Matteo Matteucci and Toshihiko Yamasaki},
  journal= {arXiv preprint arXiv:2602.02043},
  year   = {2026}
}