中文

AdaCLIP:用于零样态异常检测的混合可学习提示适配 CLIP

计算机视觉与模式识别 2025-02-17 v1

摘要

零样态异常检测(ZSAD)旨在识别来自任意新类别图像中的异常。本研究引入 AdaCLIP 用于 ZSAD 任务,利用预训练的视觉语言模型(VLM)CLIP。AdaCLIP 将可学习提示嵌入 CLIP,并通过训练于辅助注释异常检测数据进行优化。提出了两种类型的可学习提示:静态提示和动态提示。静态提示在所有图像之间共享,用以初步适配 CLIP 以进行 ZSAD。在 contrast,动态提示为每个测试图像生成,从而为 CLIP 提供动态适应能力。静态和动态提示的组合称为混合提示,并提升了 ZSAD 性能。跨越 14 个真实世界异常检测数据集(来自工业和医疗领域)的大量实验表明,AdaCLIP 在其他 ZSAD 方法上取得更好性能,并能对不同类别乃至不同领域更好地泛化。最后,我们的分析强调了多样化辅助数据和优化提示对增强泛化能力的重要性。代码已公开于 https://github.com/caoyunkang/AdaCLIP。

关键词

引用

@article{arxiv.2407.15795,
  title  = {AdaCLIP: Adapting CLIP with Hybrid Learnable Prompts for Zero-Shot Anomaly Detection},
  author = {Yunkang Cao and Jiangning Zhang and Luca Frittoli and Yuqi Cheng and Weiming Shen and Giacomo Boracchi},
  journal= {arXiv preprint arXiv:2407.15795},
  year   = {2025}
}

备注

Accepted by ECCV 2024