迈向CLIP模型鲁棒性的整体评估
计算机视觉与模式识别
2025-10-06 v2
摘要
对比语言-图像预训练(CLIP)模型显示出巨大的潜力,特别是在跨不同分布偏移的零样本分类中。基于对整体分类鲁棒性的现有评估,本工作旨在通过引入几个新视角来提供对CLIP更全面的评估。首先,我们研究了它们对特定视觉因素变化的鲁棒性。其次,我们评估了两个关键的安全目标——置信度不确定性和分布外检测——而不仅仅是分类准确性。第三,我们评估了CLIP模型连接图像和文本模态的精细程度。第四,我们将检查扩展到CLIP模型中的3D感知,超越了传统的2D图像理解。最后,我们探讨了在利用CLIP作为视觉骨干的现代大型多模态模型(LMM)中视觉和语言编码器之间的交互,重点关注这种交互如何影响分类鲁棒性。在每个方面,我们考虑了六个因素对CLIP模型的影响:模型架构、训练分布、训练集大小、微调、对比损失和测试时提示。我们的研究揭示了一些以前未知的关于CLIP的见解。例如,CLIP中视觉编码器的架构在其对3D损坏的鲁棒性中起着重要作用。CLIP模型在做出预测时倾向于表现出对形状的偏好。此外,这种偏好在ImageNet上微调后趋于减弱。像LLaVA这样的视觉-语言模型,利用CLIP视觉编码器,在具有挑战性的类别上可能比单独的CLIP表现出分类性能的优势。我们的发现有望为增强CLIP模型的鲁棒性和可靠性提供有价值的指导。
引用
@article{arxiv.2410.01534,
title = {Toward a Holistic Evaluation of Robustness in CLIP Models},
author = {Weijie Tu and Weijian Deng and Tom Gedeon},
journal= {arXiv preprint arXiv:2410.01534},
year = {2025}
}
备注
Accepted to IEEE TPAMI, extension of NeurIPS'23 work: A Closer Look at the Robustness of Contrastive Language-Image Pre-Training (CLIP)