中文

TripletCLIP:通过合成视觉-语言负样本提升CLIP的组合推理能力

计算机视觉与模式识别 2024-11-06 v1 计算与语言

摘要

对比语言-图像预训练(CLIP)模型通过最大化文本和视觉模态之间的互信息来学习表示。这使得训练数据的性质成为CLIP在下游任务中有效性的重要因素。然而,当代图像-文本数据集缺乏组合多样性,限制了CLIP的组合推理能力。我们证明,通过上下文学习生成"困难"负样本标题,并利用文本到图像生成器合成相应的负样本图像,可以提供解决方案。我们提出了一种新颖的对比预训练策略,交替利用这些困难负样本标题和图像来训练CLIP。我们证明,我们的方法TripletCLIP在应用于CC3M和CC12M等现有数据集时,增强了CLIP的组合能力,在等计算预算下SugarCrepe基准测试上实现了超过9%的绝对提升,同时在零样本图像分类和图像检索方面也有改进。我们的代码、模型和数据可在以下地址获取:https://tripletclip.github.io

关键词

引用

@article{arxiv.2411.02545,
  title  = {TripletCLIP: Improving Compositional Reasoning of CLIP via Synthetic Vision-Language Negatives},
  author = {Maitreya Patel and Abhiram Kusumba and Sheng Cheng and Changhoon Kim and Tejas Gokhale and Chitta Baral and Yezhou Yang},
  journal= {arXiv preprint arXiv:2411.02545},
  year   = {2024}
}

备注

Accepted at: NeurIPS 2024 | Project Page: https://tripletclip.github.io