中文

ContextCLIP:基于CLIP视觉表征的图像-文本对上下文对齐

计算机视觉与模式识别 2023-03-14 v1

摘要

最先进的实证研究表明,深度神经网络学习的视觉表征本质上具有鲁棒性,并能够在多样化数据集上执行分类任务。例如,CLIP在图像与文本对的联合嵌入空间中展示了在多个数据集上的零样本迁移性能。然而,其在标准数据集(如BirdsNAP、RESISC45和MNIST)上表现出负迁移性能。本文中,我们提出ContextCLIP,一种通过在Conceptual Captions数据集上学习鲁棒视觉表征来实现图像-文本对上下文对齐的上下文对比学习框架。我们观察到,该框架通过在联合嵌入空间中以上下文方式对齐文本与图像表征,改善了图像-文本对齐。ContextCLIP在文本到图像检索任务中展现出良好的定性性能,并提升了分类准确率。我们在CIFAR-10、CIFAR-100、Birdsnap、RESISC45和MNIST数据集上通过零样本迁移和微调实验对模型进行了分类任务的定量评估。

关键词

引用

@article{arxiv.2211.07122,
  title  = {ContextCLIP: Contextual Alignment of Image-Text pairs on CLIP visual representations},
  author = {Chanda Grover and Indra Deep Mastan and Debayan Gupta},
  journal= {arXiv preprint arXiv:2211.07122},
  year   = {2023}
}

备注

11 Pages, 7 Figures, 2 Tables, ICVGIP