中文

SSVP:面向工业零样本异常检测的协同语义-视觉提示

计算机视觉与模式识别 2026-01-21 v2 人工智能

摘要

零样本异常检测(Zero-Shot Anomaly Detection, ZSAD)利用视觉-语言模型(Vision-Language Models, VLMs)实现免监督的工业检测。然而,现有的 ZSAD 范式受限于单一视觉主干,难以平衡全局语义泛化能力与细粒度结构判别能力。为了弥合这一差距,我们提出了协同语义-视觉提示(Synergistic Semantic-Visual Prompting, SSVP),其高效融合了多种视觉编码以提升模型的细粒度感知能力。具体而言,SSVP 引入了分层语义-视觉协同(Hierarchical Semantic-Visual Synergy, HSVS)机制,将 DINOv3 的多尺度结构先验深度整合到 CLIP 语义空间中。随后,视觉条件提示生成器(Vision-Conditioned Prompt Generator, VCPG)采用跨模态注意力来引导动态提示生成,使语言查询能够精确锚定到特定的异常模式。此外,为了解决全局评分与局部证据之间的差异,视觉-文本异常映射器(Visual-Text Anomaly Mapper, VTAM)建立了一种双重门控校准范式。在七个工业基准上的广泛评估验证了我们方法的鲁棒性;SSVP 在 MVTec-AD 上取得了 93.0% Image-AUROC 和 92.2% Pixel-AUROC 的 SOTA 性能,显著优于现有的零样本方法。

关键词

引用

@article{arxiv.2601.09147,
  title  = {SSVP: Synergistic Semantic-Visual Prompting for Industrial Zero-Shot Anomaly Detection},
  author = {Chenhao Fu and Han Fang and Xiuzheng Zheng and Wenbo Wei and Yonghua Li and Hao Sun and Xuelong Li},
  journal= {arXiv preprint arXiv:2601.09147},
  year   = {2026}
}