RankCLIP:排序一致的语言-图像预训练
计算机视觉与模式识别
2025-03-25 v3 人工智能
机器学习
摘要
自监督对比学习模型(如 CLIP)在许多下游任务中为视觉-语言模型设定了新的基准。然而,它们对严格的一对一映射的依赖忽略了文本与图像之间及内部的复杂且通常是多方面的关系。为此,我们引入了 RankCLIP,一种新颖的预训练方法,它超越了 CLIP 及其变体严格的一对一匹配框架。通过将传统的成对损失扩展到列表级别,并利用模态内和跨模态的排序一致性,RankCLIP 改进了对齐过程,使其能够捕捉每种模态之间及内部细微的多对多关系。通过全面的实验,我们证明了 RankCLIP 在各种下游任务中的有效性,值得注意的是,在零样本分类中取得了优于 SOTA 方法的显著收益,突显了这种增强学习过程的重要性。
引用
@article{arxiv.2404.09387,
title = {RankCLIP: Ranking-Consistent Language-Image Pretraining},
author = {Yiming Zhang and Zhuokai Zhao and Zhaorun Chen and Zhili Feng and Zenghui Ding and Yining Sun},
journal= {arXiv preprint arXiv:2404.09387},
year = {2025}
}
备注
Code and model checkpoints are available at https://github.com/Jam1ezhang/RankCLIP