中文

GlocalCLIP:面向零样本异常检测的无对象依赖全局-局部提示学习

计算机视觉与模式识别 2024-12-10 v3

摘要

零样本异常检测(ZSAD)对于在无训练样本的情况下检测目标数据集中的异常模式至关重要,特别是在目标域与训练数据之间存在分布差异或因访问受限而导致数据稀缺的场景中。尽管近期预训练的视觉语言模型在各种视觉任务上展示了强大的零样本性能,但它们侧重于学习类别语义,这使得其直接应用于ZSAD具有挑战性。为解决这一场景,我们提出了GlocalCLIP,它独特地将全局和局部提示分离并联合优化。这种方法使无对象依赖的全局-局部语义提示能够有效捕获通用正常和异常模式,而不依赖于图像中的特定对象。我们利用深度文本提示调优在文本编码器中细化文本提示以进行更精确的调整。在视觉编码器中,我们应用V-V注意力层来捕获详细的局部图像特征。最后,我们引入全局-局部对比学习来改善全局和局部提示的互补学习,从而有效检测各领域中的异常模式。GlocalCLIP在ZSAD中的泛化性能在来自工业和医学领域的15个真实数据集上得到了验证,取得了优于现有方法的性能。代码将在 https://github.com/YUL-git/GlocalCLIP 发布。

关键词

引用

@article{arxiv.2411.06071,
  title  = {GlocalCLIP: Object-agnostic Global-Local Prompt Learning for Zero-shot Anomaly Detection},
  author = {Jiyul Ham and Yonggon Jung and Jun-Geol Baek},
  journal= {arXiv preprint arXiv:2411.06071},
  year   = {2024}
}

备注

29 pages, 36 figures