中文

重新评估CLIP中的模块内错位假设

计算机视觉与模式识别 2026-05-26 v2

摘要

最近的研究表明,CLIP类对比语言-图像训练产生的嵌入对于图像-only 任务 suboptimal。主要理论是,对比损失忽略了模块内(image-image)对齐,导致图像之间的距离校准不良。本研究质疑这种模块内错位假设。我们重新审视其基础理论论证、用于支持的指标以及受影响的性能指标。对于理论论证,我们证明不存在所谓的自由度用于图像嵌入距离。对于实证措施,我们发现它们对语言-图像训练的模型(CLIP、SigLIP)和图像-图像训练的模型(DINO、SigLIP2)的效果相似。这表明所观察到的现象并非源自前者特有的错位。在常用模块内任务(检索和few-shot分类)上的实验确认,解决任务歧义而非所谓错位,才是获得最佳结果的关键。

关键词

引用

@article{arxiv.2603.16100,
  title  = {Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP},
  author = {Jonas Herzog and Yue Wang},
  journal= {arXiv preprint arXiv:2603.16100},
  year   = {2026}
}

备注

Accepted for CVPR'26. Project Page: https://vision-kek.github.io/Is-CLIP-Really-Misaligned/