中文

CLIP显微镜下:多目标表示的细粒度分析

计算机视觉与模式识别 2025-03-04 v2

摘要

对比语言-图像预训练(CLIP)模型在零样本分类方面表现出色,但在复杂多目标场景中面临挑战。本研究利用一个专门设计的数据集ComCO,对CLIP在这些多样化多目标场景中的编码器进行了全面分析,揭示了其局限性。我们的发现揭示了显著偏差:文本编码器优先考虑首先提及的目标,而图像编码器偏向较大的目标。通过检索和分类任务,我们在多个CLIP变体上量化了这些偏差,并通过分析LAION数据集和训练过程追溯了其起源。我们的图像-文本匹配实验表明,当目标大小或标记顺序发生变化时,性能会出现显著下降,这凸显了CLIP在面对语义相似但重新表述的字幕时的不稳定性。将此扩展到更长字幕和文本到图像模型(如Stable Diffusion),我们展示了提示词顺序如何影响生成图像中目标的显著性。更多详情及我们的数据集和分析代码,请访问项目仓库:https://clip-oscope.github.io。

关键词

引用

@article{arxiv.2502.19842,
  title  = {CLIP Under the Microscope: A Fine-Grained Analysis of Multi-Object Representation},
  author = {Reza Abbasi and Ali Nazari and Aminreza Sefid and Mohammadali Banayeeanzade and Mohammad Hossein Rohban and Mahdieh Soleymani Baghshah},
  journal= {arXiv preprint arXiv:2502.19842},
  year   = {2025}
}

备注

Accepted at CVPR 2025