适配对比语言-图像预训练(CLIP)模型用于分布外检测
计算机视觉与模式识别
2023-11-10 v2 人工智能
机器学习
摘要
我们针对视觉分布外(OOD)检测中的预训练特征提取器进行了全面的实验研究,重点关注适配对比语言-图像预训练(CLIP)模型。无需在训练数据上进行微调,我们就能在4个基准测试中建立CLIP模型的分布内分类与无监督OOD检测之间的正相关关系()。我们进一步提出了一种新的简单且可扩展的方法,称为伪标签探测(PLP),该方法将视觉-语言模型适配于OOD检测。给定训练集的一组标签名称,PLP利用CLIP文本编码器导出的伪标签训练一个线性层。为了测试预训练模型的OOD检测鲁棒性,我们开发了一种新颖的基于特征的对抗性OOD数据操控方法来创建对抗样本。有趣的是,我们展示了:(i)PLP在基于ImageNet的所有5个大规模基准测试中均优于先前的最先进方法(\citep{ming2022mcm}),具体而言,使用最大的CLIP模型(ViT-G)平均AUROC提升了3.4%;(ii)对于CLIP架构,线性探测在性能上大幅优于微调(例如,CLIP ViT-H在所有基于ImageNet的基准测试上平均AUROC提升了7.3%);(iii)十亿参数级别的CLIP模型仍然无法检测经过对抗性操控的OOD图像。代码和对抗性创建的数据集将公开提供。
引用
@article{arxiv.2303.05828,
title = {Adapting Contrastive Language-Image Pretrained (CLIP) Models for Out-of-Distribution Detection},
author = {Nikolas Adaloglou and Felix Michels and Tim Kaiser and Markus Kollmann},
journal= {arXiv preprint arXiv:2303.05828},
year = {2023}
}
备注
version_02