中文

VisualAD:基于 Vision Transformer 的语言无零样本异常检测

计算机视觉与模式识别 2026-03-10 v1

摘要

零样本异常检测(ZSAD)需要在没有目标类异常样本的情况下检测和定位异常。主流方法依赖视觉语言模型(VLMs)如 CLIP:构建针对正常和异常语义的手工或学习提示集,然后计算图像-文本相似度进行开集判别。虽然有效,但该范式依赖文本编码器和跨模态对齐,可能导致训练不稳定和参数冗余。本工作重新审视文本分支在 ZSAD 中的必要性,提出纯视觉框架 VisualAD,基于 Vision Transformer。我们在冻结的骨干网络中引入两个可学习的 token,直接编码正常性和异常性。通过多层自注意力,这些 token 与 patch token 交互,逐步获得高层次的正常性和异常性概念,同时引导 patch 突出异常相关线索。此外,我们引入空间感知交叉注意力(SCA)模块和轻量级自对齐函数(SAF):SCA 将细粒度空间信息注入 token,SAF 在异常评分前对 patch 特征进行校准。VisualAD 在覆盖工业和医疗领域的 13 个零样本异常检测基准上实现了最先进的性能,能无缝适配如 CLIP 图像编码器和 DINOv2 等预训练视觉骨干网络。代码:https://github.com/7HHHHH/VisualAD

关键词

引用

@article{arxiv.2603.07952,
  title  = {VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer},
  author = {Yanning Hou and Peiyuan Li and Zirui Liu and Yitong Wang and Yanran Ruan and Jianfeng Qiu and Ke Xu},
  journal= {arXiv preprint arXiv:2603.07952},
  year   = {2026}
}

备注

Accepted by CVPR 2026