基于渐进调优的缺陷感知混合提示优化用于零样本多类型异常检测与分割
计算机视觉与模式识别
2026-02-12 v2
摘要
最近的视觉语言模型(VLMs)如 CLIP 通过文本提示利用高层语义信息,在显著分布偏移下展示了令人瞩目的异常检测性能。然而,这些模型往往忽略细粒度细节,例如哪种异常类型——如"孔洞"、"切割"、"划痕"——能提供对异常本质的更具体洞察。我们认为识别细粒度异常类型 1) 以结构化语义丰富"异常"的表征,缩小粗粒度异常信号与细粒度缺陷类别之间的差距;2) 使制造商能够理解异常的根本原因并快速实施更具针对性的适当纠正措施。尽管纳入此类详细语义信息至关重要,但为每种缺陷类型设计手工提示既耗时又容易受到人为偏差的影响。为此,我们提出 DAPO,一种基于渐进调优的缺陷感知提示优化方法,用于分布偏移下的零样本多类型与二元异常检测和分割。我们的方法通过学习同时包含固定文本锚点和可学习 token 嵌入的混合缺陷感知提示,将异常相关的图像特征与其对应的文本语义对齐。我们在公共基准数据集(MPDD、VisA、MVTec-AD、MAD 和 Real-IAD)以及一个内部数据集上进行了实验。结果表明,与基线模型相比,DAPO 在分布偏移下的图像级 AUROC 和平均精度指标上实现了 3.7% 的平均提升,在零样本设置下定位新型异常类型实现了 6.5% 的平均提升。
引用
@article{arxiv.2512.09446,
title = {Defect-aware Hybrid Prompt Optimization via Progressive Tuning for Zero-Shot Multi-type Anomaly Detection and Segmentation},
author = {Nadeem Nazer and Hongkuan Zhou and Lavdim Halilaj and Ylli Sadikaj and Steffen Staab},
journal= {arXiv preprint arXiv:2512.09446},
year = {2026}
}