中文

基于 CLIP 的随机词数据增强用于零样本异常检测

计算机视觉与模式识别 2023-09-26 v2 机器学习

摘要

本文提出了一种新颖的方法,利用视觉-语言模型 CLIP 作为零样本异常检测的数据源。由于异常检测器潜在的工业应用价值,人们已投入大量精力开发异常检测器。考虑到难以获取各类异常样本用于训练,现有多数方法仅使用正常样本训练模型,并在推理时度量与正常样本分布的差异,这需要对每个对象类别训练一个模型。这种低效训练需求的问题已通过设计基于 CLIP 的异常检测器得到解决,该检测器以滑动窗口方式对图像各部分进行提示引导的分类。然而,该方法仍受制于针对已知对象类别的精细提示集成工作。为克服上述问题,我们提出将 CLIP 用作训练数据源。我们的方法利用 CLIP 中的文本编码器,以包含正常与异常词汇的典型提示生成文本嵌入。除这些词外,我们将若干随机生成的词插入提示中,使编码器生成多样化的正常与异常样本集合。使用生成的嵌入作为训练数据,一个前馈神经网络学习从 CLIP 的嵌入中提取正常与异常特征,从而可在无任何训练图像的情况下获得类别无关的异常检测器。实验结果表明,我们的方法在零样本设定下无需繁重的提示集成即可达到最先进的性能。

关键词

引用

@article{arxiv.2308.11119,
  title  = {Random Word Data Augmentation with CLIP for Zero-Shot Anomaly Detection},
  author = {Masato Tamura},
  journal= {arXiv preprint arXiv:2308.11119},
  year   = {2023}
}

备注

Accepted to BMVC2023