中文

AdaptCLIP:用于通用视觉异常检测的自适应 CLIP 方法

计算机视觉与模式识别 2025-05-20 v2 人工智能

摘要

通用视觉异常检测旨在无需额外微调即可从新颖或未见的视觉领域中识别异常。近期研究表明,预训练的视觉语言模型如 CLIP 仅通过零样或少量正常图像即可展现出强大的泛化能力。然而,现有方法在设计提示模板、复杂的标记交互或需要额外微调方面受限,导致灵活性受限。本文提出一种简单而有效的方法,称为 AdaptCLIP,基于两个关键洞察:首先,自适应的视觉和文本表示应交替学习,而非联合学习;其次,查询与正常图像提示之间的比较学习应包含上下文特征和对齐残差特征,而非仅依赖残差特征。AdaptCLIP 将 CLIP 模型视为基础服务,仅在其输入或输出端添加三个简单的适配器:视觉适配器、文本适配器和提示查询适配器。AdaptCLIP 支持跨域的零/少样本泛化,在基础数据集上训练后即可在目标域实现无训练。AdaptCLIP 在 12 个来自工业和医疗领域的异常检测基准测试上实现了最先进的性能,显著优于现有竞争方法。我们将在 https://github.com/gaobb/AdaptCLIP 上公开 AdaptCLIP 的代码和模型。

关键词

引用

@article{arxiv.2505.09926,
  title  = {AdaptCLIP: Adapting CLIP for Universal Visual Anomaly Detection},
  author = {Bin-Bin Gao and Yue Zhou and Jiangtao Yan and Yuezhi Cai and Weixi Zhang and Meng Wang and Jun Liu and Yong Liu and Lei Wang and Chengjie Wang},
  journal= {arXiv preprint arXiv:2505.09926},
  year   = {2025}
}

备注

27 pages, 15 figures, 22 tables