VMAD:面向零样本异常检测的视觉增强多模态大语言模型
计算机视觉与模式识别
2026-04-02 v2
摘要
零样本异常检测(ZSAD)通过建立文本提示与检测图像之间的特征映射,识别并定位未见过的物体中的异常,在灵活工业制造中展现出重要的研究价值。然而,现有的ZSAD方法受限于封闭世界设定,难以通过预定义提示检测未见缺陷。最近,将多模态大语言模型(MLLM)应用于工业异常检测(IAD)提供了一种可行的解决方案。与固定提示方法不同,MLLM展现出具有开放式文本解释的生成范式,能够实现更自适应的异常分析。然而,这种适配面临固有挑战,因为异常通常出现在细粒度区域,且与正常样本的视觉差异极小。为解决这些问题,我们提出了一种新颖框架VMAD(视觉增强MLLM异常检测),该框架通过基于视觉的IAD知识和细粒度感知增强MLLM,同时提供精确的异常检测和全面的异常分析。具体来说,我们设计了一种缺陷敏感结构学习方案,将视觉分支的块相似性线索迁移至MLLM,以提升异常判别能力。此外,我们引入了一种新颖的视觉投影器——局部性增强令牌压缩,该投影器挖掘局部上下文中的多级特征以增强细粒度检测。进一步,我们引入了真实工业异常检测(RIAD)数据集,这是一个包含详细异常描述和分析的综合性IAD数据集,为基于MLLM的IAD开发提供了宝贵资源。在零样本基准测试(包括MVTec-AD、Visa、WFDD和RIAD数据集)上的大量实验表明,我们的性能优于现有最先进方法。代码和数据集将很快公开。
引用
@article{arxiv.2409.20146,
title = {VMAD: Visual-enhanced Multimodal Large Language Model for Zero-Shot Anomaly Detection},
author = {Huilin Deng and Hongchen Luo and Wei Zhai and Yang Cao and Yu Kang},
journal= {arXiv preprint arXiv:2409.20146},
year = {2026}
}