中文

零样本图像异常检测的自动提示生成与对象定位

计算机视觉与模式识别 2024-12-02 v1 多媒体

摘要

识别工业产品中的缺陷和异常是关键的质量控制任务。传统的手动检查方法缓慢、主观且容易出错。在本工作中,我们提出了一种 novel 的零样本无训练方法,用于自动化工业图像异常检测,采用由三个基础模型构成的多模态机器学习管道。该方法首先使用大型语言模型(如 GPT-3)生成描述正常和异常产品外观的文本提示。随后,我们使用称为 Grounding DINO 的定位对象检测模型在图像中定位产品。最后,我们使用称为 CLIP 的零样本图像-文本匹配模型将裁剪后的产品图像块与生成的提示进行比较,以识别任何异常。我们在两个工业产品图像数据集(即 MVTec-AD 和 VisA)上的实验表明,该方法有效,能够在无需模型训练的情况下实现对各种类型缺陷和异常的高精度检测。我们提出的模型使工业制造中的质量控制实现了高效、可扩展且客观。

关键词

引用

@article{arxiv.2411.19220,
  title  = {Automatic Prompt Generation and Grounding Object Detection for Zero-Shot Image Anomaly Detection},
  author = {Tsun-Hin Cheung and Ka-Chun Fung and Songjiang Lai and Kwan-Ho Lin and Vincent Ng and Kin-Man Lam},
  journal= {arXiv preprint arXiv:2411.19220},
  year   = {2024}
}

备注

Accepted to APSIPA ASC 2024