中文

CLIP 理想吗?不理想。我们可以修复它吗?可以!

机器学习 2026-03-17 v3 计算机视觉与模式识别

摘要

Contrastive Language-Image Pre-Training (CLIP) 是一种流行的方法,用于学习具有良好组织语义的多模态潜在空间。尽管其应用广泛,但已知 CLIP 的潜在空间在处理复杂的视觉-文本交互方面存在不足。最近的工作尝试通过数据中心或算法方法来解决其不足之处。但问题是否更根本地存在于 CLIP 的几何结构中?为此,我们严格分析了 CLIP 的潜在空间属性,证明了没有任何 CLIP 风格的联合嵌入空间可以同时正确完成以下两项任务中的任意两项:1. 表示基本描述和图像内容,2. 表示属性绑定,3. 表示空间位置和关系,4. 表示否定。基于我们的分析,我们提出 Dense Cosine Similarity Maps (DCSMs) 作为一种原则性且可解释的评分方法,用于 CLIP 风格模型,通过保留图像补丁和文本标记的语义拓扑,解决了 CLIP 的根本性局限性。该方法在广泛的基准测试上提高了经典 CLIP 风格联合编码器模型的性能。我们在此分享代码和数据以便可重复性: https://github.com/Raphoo/DCSM_Ideal_CLIP

关键词

引用

@article{arxiv.2503.08723,
  title  = {Is CLIP ideal? No. Can we fix it? Yes!},
  author = {Raphi Kang and Yue Song and Georgia Gkioxari and Pietro Perona},
  journal= {arXiv preprint arXiv:2503.08723},
  year   = {2026}
}

备注

ICCV 2025