中文

通过生成反事实集实现CLIP组合推理的视觉飞跃

计算机视觉与模式识别 2025-07-08 v1

摘要

视觉语言模型(VLM)常因缺乏高质量图像-文本数据而在组合推理上表现不佳。为应对这一挑战,我们提出了一种新颖的基于块的扩散方法,无需人工标注即可自动生成反事实数据集。我们的方法利用大型语言模型识别实体及其空间关系,然后独立生成图像块作为“拼图碎片”,并根据指定的组合规则连贯排列。这一过程创建了多样、高保真的反事实图像-文本对,并具有精确控制的变异性。此外,我们引入了一种专门的损失函数,用于区分集合间和集合内的样本,从而提高训练效率并减少对负样本的需求。实验表明,使用我们的反事实数据集微调VLM显著提升了视觉推理性能。我们的方法在多个基准测试中取得了最先进的结果,同时使用的训练数据远少于现有方法。

关键词

引用

@article{arxiv.2507.04699,
  title  = {A Visual Leap in CLIP Compositionality Reasoning through Generation of Counterfactual Sets},
  author = {Zexi Jia and Chuanwei Huang and Hongyan Fei and Yeshuang Zhu and Zhiqiang Yuan and Ying Deng and Jiapei Zhang and Jinchao Zhang and Jie Zhou},
  journal= {arXiv preprint arXiv:2507.04699},
  year   = {2025}
}