中文

通过适配预训练视觉语言模型实现异常检测

计算机视觉与模式识别 2024-03-15 v1

摘要

最近,大型视觉和语言模型在适配许多下游任务方面显示出成功。本文提出了统一框架CLIP-ADA用于通过适配预训练的CLIP模型实现异常检测。为此,我们做了两个重要改进:1)为实现跨多个工业图像类别的统一异常检测,我们引入可学习提示并提出通过自监督学习将其与异常模式关联。2)为充分利用CLIP的表示能力,我们引入异常区域细化策略以细化定位质量。在测试期间,异常通过直接计算可学习提示表示与图像之间的相似度进行定位。综合实验表明,我们的方法在MVTec-AD和VisA上分别实现了97.5/55.6和89.3/33.1的领先水平。在此基础上,本文还表明该方法在数据有限的情况下也能取得令人满意的性能,这更具挑战性。

关键词

引用

@article{arxiv.2403.09493,
  title  = {Anomaly Detection by Adapting a pre-trained Vision Language Model},
  author = {Yuxuan Cai and Xinwei He and Dingkang Liang and Ao Tong and Xiang Bai},
  journal= {arXiv preprint arXiv:2403.09493},
  year   = {2024}
}