中文

VCP-CLIP:用于零样本异常分割的视觉上下文激活模型

计算机视觉与模式识别 2024-07-18 v1

摘要

最近,大规模视觉语言模型如CLIP在零样本异常分割(ZSAS)任务中显示出巨大的潜力,利用统一模型直接检测任何未见产品上的异常,需仔细构建文本提示。然而,现有方法常假设要检查的产品类别已知,从而设置产品特定的文本提示,在数据隐私场景下难以实现。此外,相同类型的产品因具体组件和生产工艺的差异而呈现出显著差异,给文本提示设计提出了重大挑战。为此,我们提出一种基于CLIP的视觉上下文激活模型(VCP-CLIP),用于ZSAS任务。VCP-CLIP的核心思想是利用视觉上下文激活CLIP的异常语义感知能力。具体而言,我们首先设计了Pre-VCP模块,将全局视觉信息嵌入文本提示,从而消除对产品特定提示的需求。然后,我们提出了一种新的Post-VCP模块,通过图像的细粒度特征调整文本嵌入。在在10个真实世界工业异常分割数据集上进行的大量实验表明,VCP-CLIP在ZSAS任务中取得了最先进的性能。代码已公开于https://github.com/xiaozhen228/VCP-CLIP。

关键词

引用

@article{arxiv.2407.12276,
  title  = {VCP-CLIP: A visual context prompting model for zero-shot anomaly segmentation},
  author = {Zhen Qu and Xian Tao and Mukesh Prasad and Fei Shen and Zhengtao Zhang and Xinyi Gong and Guiguang Ding},
  journal= {arXiv preprint arXiv:2407.12276},
  year   = {2024}
}