中文

面向统一零样本异常定位的引导式细粒度视觉-语言对齐

计算机视觉与模式识别 2024-02-28 v2

摘要

对比语言-图像预训练(CLIP)模型通过在自然语言监督下学习视觉表示,在零样本视觉识别任务上展现出有前景的性能。近期研究尝试利用 CLIP 通过匹配图像与正常及异常状态提示来处理零样本异常检测。然而,由于 CLIP 侧重于建立配对文本提示与全局图像级表示之间的对应,缺乏细粒度块级视觉到文本对齐限制了其在精确视觉异常定位上的能力。本工作中,我们提出 AnoCLIP 用于零样本异常定位。在视觉编码器中,我们引入一种无需训练的逐值注意力机制,以提取 CLIP 的固有局部 token 用于块级局部描述。从文本监督的角度,我们特别设计了一种统一的域感知对比状态提示模板,用于细粒度视觉-语言匹配。在提出的 AnoCLIP 基础上,我们进一步引入一种测试时自适应(TTA)机制来精炼视觉异常定位结果,其中我们利用 AnoCLIP 的伪标签与加噪 token 优化视觉编码器中的轻量适配器。借助 AnoCLIP 与 TTA,我们充分挖掘了 CLIP 在零样本异常定位上的潜力,并在多个数据集上展示了 AnoCLIP 的有效性。

关键词

引用

@article{arxiv.2308.15939,
  title  = {Bootstrap Fine-Grained Vision-Language Alignment for Unified Zero-Shot Anomaly Localization},
  author = {Hanqiu Deng and Zhaoxiang Zhang and Jinan Bao and Xingyu Li},
  journal= {arXiv preprint arXiv:2308.15939},
  year   = {2024}
}