中文

Crane:用于零样态异常检测的上下文引导的提示学习与注意力细化

计算机视觉与模式识别 2025-08-12 v2

摘要

异常检测涉及识别数据分布中偏离正常情况的模式,在医学诊断和工业缺陷检测等领域至关重要。传统方法通常需要正常训练样本的存在,但这在实际中并非总是可行。最近,CLIP 的丰富预训练知识在无需来自目标域训练样本的情况下展现出检测异常的零样态泛化潜力。然而,CLIP 的粗粒度图像-文本对齐限制了其对局部异常模式的局部化和检测性能,主要源于:(1)空间错位,(2)全局特征对局部异常模式的灵敏度有限。本文提出 Crane 方法以解决上述问题。首先,我们引入基于相关性的注意力模块以更准确地保持空间对齐。其次,为提升模型对细粒度异常的感知能力,我们将文本编码器的可学习提示基于视觉编码器提取的图像上下文进行条件化,并执行局部到全局表示融合。此外,我们的方法可整合视觉基础模型如 DINOv2 以进一步增强空间理解与局部化。Crane 的核心思想是:在建模异常概念的可学习适应性与保持和利用通用预训练知识的非可学习适应性之间取得平衡,从而最小化领域内过拟合,最大化在未见域上的性能。广泛的在 14 个多样化工业和医疗数据集上的评估表明,Crane 在图像和像素水平上持续将零样态异常检测的 SOTA 提升 2% 至 28%,同时保持推理速度的竞争性。代码已公开于 https://github.com/AlirezaSalehy/Crane。

关键词

引用

@article{arxiv.2504.11055,
  title  = {Crane: Context-Guided Prompt Learning and Attention Refinement for Zero-Shot Anomaly Detection},
  author = {Alireza Salehi and Mohammadreza Salehi and Reshad Hosseini and Cees G. M. Snoek and Makoto Yamada and Mohammad Sabokrou},
  journal= {arXiv preprint arXiv:2504.11055},
  year   = {2025}
}