中文

冷静审视CLIP模型对伪特征的鲁棒性

计算机视觉与模式识别 2024-11-05 v2 机器学习 机器学习

摘要

大型视觉语言模型(如CLIP)相比在ImageNet上训练的单模态模型,展现出对伪特征令人印象深刻的鲁棒性。然而,现有的测试数据集通常基于ImageNet训练的模型来构建,旨在捕捉ImageNet中固有的伪特征。基于面向ImageNet的伪特征来评估CLIP模型,可能不足以反映CLIP模型对其自身训练数据(例如LAION)中伪相关性的鲁棒程度。为此,我们精心构建了一个名为CounterAnimal的新挑战性数据集,旨在揭示CLIP模型对现实伪特征的依赖。具体来说,我们根据背景将动物照片分组,然后为每个类别识别出一对组别,其中CLIP模型在这两个组别之间表现出显著的性能下降。我们的评估表明,CounterAnimal所捕捉的伪特征被具有不同骨干网络和预训练数据的CLIP模型普遍学习到,但对ImageNet模型影响有限。我们提供了理论见解,证明CLIP目标函数无法提供额外的鲁棒性。此外,我们还重新评估了诸如扩大参数规模和使用高质量预训练数据等策略。我们发现它们仍然有助于减轻伪特征的影响,为未来发展提供了一条有前景的路径。

关键词

引用

@article{arxiv.2403.11497,
  title  = {A Sober Look at the Robustness of CLIPs to Spurious Features},
  author = {Qizhou Wang and Yong Lin and Yongqiang Chen and Ludwig Schmidt and Bo Han and Tong Zhang},
  journal= {arXiv preprint arXiv:2403.11497},
  year   = {2024}
}

备注

NeurIPS 2024; Qizhou Wang, Yong Lin, and Yongqiang Chen contributed equally; Project page: https://counteranimal.github.io