中文

FADE:利用大型视觉-语言模型的少样本/零样本异常检测引擎

计算机视觉与模式识别 2024-09-04 v1

摘要

自动图像异常检测对于制造业的质量检验至关重要。通常的无监督异常检测方法是为每个对象类别使用正常样本数据集训练一个模型。然而,一个更现实的问题是零样本/少样本异常检测,即只有零个或极少数正常样本可用。这使得训练特定于对象的模型变得具有挑战性。最近,大型基础视觉语言模型在各种下游任务中展现出强大的零样本性能。虽然这些模型已经学习了视觉和语言之间的复杂关系,但它们并非专门为异常检测任务而设计。本文提出了少样本/零样本异常检测引擎(FADE),它利用视觉语言CLIP模型并对其进行调整,以适应工业异常检测的目的。具体来说,我们改进了语言引导的异常分割:1)通过调整CLIP以提取与语言更好对齐的多尺度图像块嵌入;2)通过自动生成与工业异常检测相关的文本提示集合。3)我们利用来自查询图像和参考图像的额外视觉引导,进一步改进零样本和少样本异常检测。在MVTec-AD(和VisA)数据集上,FADE在异常分割方面优于其他最先进的方法,在零样本设置下像素级AUROC达到89.6%(91.5%),在1个正常样本设置下达到95.4%(97.5%)。代码可在https://github.com/BMVC-FADE/BMVC-FADE获取。

关键词

引用

@article{arxiv.2409.00556,
  title  = {FADE: Few-shot/zero-shot Anomaly Detection Engine using Large Vision-Language Model},
  author = {Yuanwei Li and Elizaveta Ivanova and Martins Bruveris},
  journal= {arXiv preprint arXiv:2409.00556},
  year   = {2024}
}

备注

13 pages, 2 figures, Accepted for BMVC 2024