中文

深入审视对比语言-图像预训练(CLIP)的鲁棒性

计算机视觉与模式识别 2024-02-13 v1 机器学习

摘要

对比语言-图像预训练(CLIP)模型在多个具有挑战性的分布偏移中展现了卓越的泛化能力。然而,关于它们对特定视觉因素变化的鲁棒性,仍有很多值得探索之处。在现实应用中,可靠且安全的系统必须考虑超越分类准确性的其他安全目标,例如预测不确定性。然而,CLIP 模型在此类安全相关特征上的有效性探索较少。基于上述原因,本工作全面研究了 CLIP 模型的安全目标,特别关注三个关键特性:对视觉因素变化的韧性、校准的不确定性估计以及检测异常输入的能力。为此,我们研究了 83 个 CLIP 模型和 127 个 ImageNet 分类器。它们在架构、(预)训练分布和训练策略上各不相同。我们考虑了 10 种视觉因素(例如,形状和图案)、5 种分布外数据类型,以及 8 种具有不同偏移类型(如纹理、风格和扰动偏移)的自然且具有挑战性的测试条件。我们的研究揭示了关于 CLIP 模型的一些先前未知的见解。例如,它们并不总是比其他 ImageNet 模型具有更好的校准度,这与现有发现相矛盾。此外,我们的分析通过展示训练源设计对三个安全相关属性的深远影响,强调了其重要性。我们相信,我们的全面研究可以阐明并帮助指导开发更鲁棒、更可靠的 CLIP 模型。

关键词

引用

@article{arxiv.2402.07410,
  title  = {A Closer Look at the Robustness of Contrastive Language-Image Pre-Training (CLIP)},
  author = {Weijie Tu and Weijian Deng and Tom Gedeon},
  journal= {arXiv preprint arXiv:2402.07410},
  year   = {2024}
}

备注

Accepted by NeurIPS 2023