分析CLIP在多目标场景中的性能局限:一项受控的高分辨率研究
计算机视觉与模式识别
2025-02-28 v1
摘要
对比语言-图像预训练(CLIP)模型在零样本分类任务中已展现出显著性能,但其在处理复杂多目标场景中的有效性仍面临挑战。本研究通过受控实验全面分析了CLIP在多目标语境中的性能局限。我们引入两个自定义数据集SimCO和CompCO,用于评估CLIP的图像编码器和文本编码器在不同多目标配置下的表现。研究发现两个编码器均存在显著偏差:图像编码器偏向较大目标,而文本编码器优先关注描述中首先提到的目标。我们假设这些偏差源于CLIP的训练过程,并通过COCO数据集分析和CLIP训练进程演变的分析提供了证据。此外,我们将研究扩展至Stable Diffusion模型,发现CLIP文本编码器的偏差显著影响文本到图像生成任务。实验表明这些偏差如何影响CLIP在图像-描述匹配和生成任务中的性能,特别是在操控目标尺寸及其在描述中的顺序时。本工作为理解CLIP在复杂视觉环境中的行为提供了宝贵见解,并指出了未来视觉-语言模型的改进方向。
引用
@article{arxiv.2502.19828,
title = {Analyzing CLIP's Performance Limitations in Multi-Object Scenarios: A Controlled High-Resolution Study},
author = {Reza Abbasi and Ali Nazari and Aminreza Sefid and Mohammadali Banayeeanzade and Mohammad Hossein Rohban and Mahdieh Soleymani Baghshah},
journal= {arXiv preprint arXiv:2502.19828},
year = {2025}
}
备注
Accepted at ECCV 2024 Workshop EVAL-FoMo