中文

ViP$^2$-CLIP:用于零样态异常检测的视觉-感知提示统一对齐

计算机视觉与模式识别 2025-10-07 v3 人工智能

摘要

零样态异常检测(ZSAD)旨在检测不包含任何目标域训练样本的异常,仅依赖外部辅助数据。现有 CLIP-based 方法试图通过手工设计或静态可学习提示激发模型的 ZSAD 潜能。前者工程成本高且语义覆盖有限,而后者则对不同异常类型应用相同的描述,无法适应复杂变化。此外,由于 CLIP 最初是在大规模分类任务上预训练的,其异常分割质量对类别名称的准确表述高度敏感,这限制了依赖类别标签的提示策略。为解决上述挑战,我们提出 ViP2^{2}-CLIP。ViP2^{2}-CLIP 的关键思想是引入视觉-感知提示(ViP-Prompt)机制,将全局和多尺度局部视觉上下文融合,以自适应方式生成细粒度文本提示,消除手动模板和类别名称先验。这一设计使模型能够专注于精确的异常区域,特别适用于类别名称模糊或受隐私限制的场景。在 15 个工业和医疗基准测试中,ViP2^{2}-CLIP 实现了最先进的性能和稳健的跨域泛化能力。

关键词

引用

@article{arxiv.2505.17692,
  title  = {ViP$^2$-CLIP: Visual-Perception Prompting with Unified Alignment for Zero-Shot Anomaly Detection},
  author = {Ziteng Yang and Jingzehua Xu and Yanshu Li and Zepeng Li and Yeqiang Wang and Xinghui Li},
  journal= {arXiv preprint arXiv:2505.17692},
  year   = {2025}
}