中文

AnomalyVFM -- 将视觉基础模型转化为零样本异常检测器

计算机视觉与模式识别 2026-04-10 v2

摘要

零样本异常检测旨在无需访问领域内任何训练图像的情况下检测和定位图像中的异常区域。虽然最近的方法利用视觉语言模型(VLM)如 CLIP 来传递高层次概念知识,但基于纯视觉基础模型(VFM)的方法(如 DINOv2)在性能上仍落后于人类。我们认为,这一差距源于两个实际问题:(i)现有辅助异常检测数据集的多样性有限,(ii)VFM 适应策略过于浅薄。为解决这两个挑战,我们提出了 AnomalyVFM,一个通用且有效的框架,可将任何预训练 VFM 转化为强大的零样本异常检测器。我们的方法结合了稳健的三阶段合成数据集生成方案和参数高效适应机制,利用低秩特征适配器和置信度加权像素损失。通过这些组件,现代 VFM 能够显著超越当前最先进的方法。具体而言,以 RADIO 作为背bone,AnomalyVFM 在 9 个多样化数据集上实现了 94.1% 的平均图像级 AUROC,超越了之前方法的显著 3.3 个百分点。项目页面: https://maticfuc.github.io/anomaly_vfm/

关键词

引用

@article{arxiv.2601.20524,
  title  = {AnomalyVFM -- Transforming Vision Foundation Models into Zero-Shot Anomaly Detectors},
  author = {Matic Fučka and Vitjan Zavrtanik and Danijel Skočaj},
  journal= {arXiv preprint arXiv:2601.20524},
  year   = {2026}
}

备注

Accepted to CVPR 2026