GPT-4V-AD:探索面向VQA的GPT-4V在零样本异常检测中的定位潜力
计算机视觉与模式识别
2024-04-17 v2
摘要
大型多模态模型(Large Multimodal Model, LMM) GPT-4V(ision)赋予GPT-4以视觉定位能力,使其可通过视觉问答(Visual Question Answering, VQA)范式处理特定任务。本文探索面向VQA的GPT-4V在近期热门的视觉异常检测(Anomaly Detection, AD)中的潜力,并首次在流行的MVTec AD与VisA数据集上进行定性与定量评估。考虑到该任务需要图像级/像素级评估,所提GPT-4V-AD框架包含三个组件:\textbf{\textit{1)}} 细粒度区域划分,\textbf{\textit{2)}} 提示设计,\textbf{\textit{3)}} 文本转分割以实现便捷定量评估,并进行了若干不同尝试用于对比分析。结果表明,GPT-4V可通过VQA范式在零样本AD任务中取得一定结果,例如在MVTec AD与VisA数据集上分别取得图像级77.1/88.0与像素级68.0/76.6的AU-ROC。然而,其性能相较于最先进的零样本方法(如WinCLIP与CLIP-AD)仍存在一定差距,需进一步研究。本研究为面向VQA的LMM在零样本AD任务中的研究提供基线参考,并给出若干可能的未来工作。代码见 \url{https://github.com/zhangzjn/GPT-4V-AD}。
引用
@article{arxiv.2311.02612,
title = {GPT-4V-AD: Exploring Grounding Potential of VQA-oriented GPT-4V for Zero-shot Anomaly Detection},
author = {Jiangning Zhang and Haoyang He and Xuhai Chen and Zhucun Xue and Yabiao Wang and Chengjie Wang and Lei Xie and Yong Liu},
journal= {arXiv preprint arXiv:2311.02612},
year = {2024}
}