CLIP的双椭球几何
计算机视觉与模式识别
2025-05-27 v3
摘要
对比式语言-图像预训练(CLIP)在机器学习应用中发挥着重要作用。我们研究了这种嵌入的几何结构,这一结构仍不太为人所理解。我们检查了原始未归一化的嵌入,发现文本和图像位于以原点不为中心的线性可分椭球壳层上。我们阐述了具有这一结构的优势,能够根据对比训练期间的不确定性更好地嵌入实例。数据集中频繁出现的概念会产生更多假负例,从而诱发更大的不确定性。引入了一种新的概念,即“符合度”,用于衡量实例与代表数据集中任何其他实例的平均余弦相似性。我们显示,这一度量可以通过仅计算实例与模态均值向量的余弦相似性来准确估计。此外,我们发现CLIP的模态间隙优化了图像和文本符合度分布的匹配。
引用
@article{arxiv.2411.14517,
title = {The Double-Ellipsoid Geometry of CLIP},
author = {Meir Yossef Levi and Guy Gilboa},
journal= {arXiv preprint arXiv:2411.14517},
year = {2025}
}
备注
Accepted to ICML 2025. This version matches the camera-ready version