AnomalyGPT:利用大型视觉-语言模型检测工业异常
计算机视觉与模式识别
2023-12-29 v4
摘要
MiniGPT-4 和 LLaVA 等大型视觉-语言模型(LVLMs)已展现出理解图像的能力,并在各类视觉任务中取得卓越性能。尽管得益于海量训练数据集,它们具备识别常见物体的强大能力,但缺乏特定领域知识且对物体内部局部细节理解较弱,这阻碍了其在工业异常检测(IAD)任务中的有效性。另一方面,多数现有 IAD 方法仅提供异常分数,并需手动设定阈值以区分正常与异常样本,限制了其实用部署。本文探索利用 LVLM 解决 IAD 问题,并提出 AnomalyGPT,一种基于 LVLM 的新型 IAD 方法。我们通过模拟异常图像并为每幅图像生成相应文本描述来构建训练数据。我们还采用图像解码器提供细粒度语义,并设计提示学习器利用提示嵌入微调 LVLM。我们的 AnomalyGPT 消除了手动阈值调整的需要,从而直接判断异常的存在与位置。此外,AnomalyGPT 支持多轮对话,并展现出令人惊叹的少样本上下文学习能力。仅用一张正常样本,AnomalyGPT 在 MVTec-AD 数据集上以 86.1% 的准确率、94.1% 的图像级 AUC 和 95.3% 的像素级 AUC 达到最先进性能。代码见 https://github.com/CASIA-IVA-Lab/AnomalyGPT。
引用
@article{arxiv.2308.15366,
title = {AnomalyGPT: Detecting Industrial Anomalies Using Large Vision-Language Models},
author = {Zhaopeng Gu and Bingke Zhu and Guibo Zhu and Yingying Chen and Ming Tang and Jinqiao Wang},
journal= {arXiv preprint arXiv:2308.15366},
year = {2023}
}
备注
Accepted by AAAI 2024; Project page: https://anomalygpt.github.io