ViP$^2$-CLIP:用于零样态异常检测的视觉-感知提示统一对齐
计算机视觉与模式识别
2025-10-07 v3 人工智能
摘要
零样态异常检测(ZSAD)旨在检测不包含任何目标域训练样本的异常,仅依赖外部辅助数据。现有 CLIP-based 方法试图通过手工设计或静态可学习提示激发模型的 ZSAD 潜能。前者工程成本高且语义覆盖有限,而后者则对不同异常类型应用相同的描述,无法适应复杂变化。此外,由于 CLIP 最初是在大规模分类任务上预训练的,其异常分割质量对类别名称的准确表述高度敏感,这限制了依赖类别标签的提示策略。为解决上述挑战,我们提出 ViP-CLIP。ViP-CLIP 的关键思想是引入视觉-感知提示(ViP-Prompt)机制,将全局和多尺度局部视觉上下文融合,以自适应方式生成细粒度文本提示,消除手动模板和类别名称先验。这一设计使模型能够专注于精确的异常区域,特别适用于类别名称模糊或受隐私限制的场景。在 15 个工业和医疗基准测试中,ViP-CLIP 实现了最先进的性能和稳健的跨域泛化能力。
引用
@article{arxiv.2505.17692,
title = {ViP$^2$-CLIP: Visual-Perception Prompting with Unified Alignment for Zero-Shot Anomaly Detection},
author = {Ziteng Yang and Jingzehua Xu and Yanshu Li and Zepeng Li and Yeqiang Wang and Xinghui Li},
journal= {arXiv preprint arXiv:2505.17692},
year = {2025}
}