CyCLIP:循环对比语言-图像预训练
计算机视觉与模式识别
2022-10-28 v2 机器学习
摘要
近期,基于配对图像-文本数据的对比表示学习进展催生了诸如 CLIP 等模型,其在零样本分类和分布鲁棒性方面达到了最先进性能。此类模型通常需要在图像和文本表示空间中进行联合推理以完成下游推理任务。与先前认知相反,我们证明了通过标准对比目标学习的图像和文本表示并不可互换,并可能导致不一致的下游预测。为缓解该问题,我们形式化了一致性并提出了 CyCLIP,一种显式优化所学表示在图像和文本空间中几何一致的对比表示学习框架。具体而言,我们表明一致表示可通过显式对称化以下两者来学习:(a)两个不匹配图像-文本对之间的相似性(跨模态一致性);以及(b)图像-图像对与文本-文本对之间的相似性(模态内一致性)。在经验上,我们表明 CyCLIP 中改进的一致性转化为相对于 CLIP 的显著增益,在标准基准(CIFAR-10、CIFAR-100、ImageNet1K)上零样本分类准确率提升 10%–24%,对各种自然分布偏移的鲁棒性提升 10%–27%。代码可在 https://github.com/goel-shashank/CyCLIP 获取。
引用
@article{arxiv.2205.14459,
title = {CyCLIP: Cyclic Contrastive Language-Image Pretraining},
author = {Shashank Goel and Hritik Bansal and Sumit Bhatia and Ryan A. Rossi and Vishwa Vinay and Aditya Grover},
journal= {arXiv preprint arXiv:2205.14459},
year = {2022}
}
备注
19 pages, 13 tables, 6 figures, Oral at NeuRIPS 2022