重新评估CLIP中的模块内错位假设
计算机视觉与模式识别
2026-05-26 v2
摘要
最近的研究表明,CLIP类对比语言-图像训练产生的嵌入对于图像-only 任务 suboptimal。主要理论是,对比损失忽略了模块内(image-image)对齐,导致图像之间的距离校准不良。本研究质疑这种模块内错位假设。我们重新审视其基础理论论证、用于支持的指标以及受影响的性能指标。对于理论论证,我们证明不存在所谓的自由度用于图像嵌入距离。对于实证措施,我们发现它们对语言-图像训练的模型(CLIP、SigLIP)和图像-图像训练的模型(DINO、SigLIP2)的效果相似。这表明所观察到的现象并非源自前者特有的错位。在常用模块内任务(检索和few-shot分类)上的实验确认,解决任务歧义而非所谓错位,才是获得最佳结果的关键。
引用
@article{arxiv.2603.16100,
title = {Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP},
author = {Jonas Herzog and Yue Wang},
journal= {arXiv preprint arXiv:2603.16100},
year = {2026}
}
备注
Accepted for CVPR'26. Project Page: https://vision-kek.github.io/Is-CLIP-Really-Misaligned/