中文

ACD-CLIP:面向零样本异常检测的解耦表示与动态融合

计算机视觉与模式识别 2026-03-30 v6 人工智能 机器学习

摘要

预训练的视觉-语言模型(VLM)在零样本异常检测(ZSAD)中面临关键的适应鸿沟:它们缺乏密集预测所需的局部归纳偏置,并采用不灵活的特征融合范式。我们通过一种架构协同设计框架来解决这些局限性,该框架联合优化特征表示和跨模态融合。我们的方法提出了一种参数高效的卷积低秩适配(Conv-LoRA)适配器,用于注入局部归纳偏置以实现细粒度表示,并引入了一个动态融合网关(DFG),利用视觉上下文自适应地调制文本提示,从而实现强大的双向融合。在多种工业和医学基准上的大量实验证明了其优越的准确性和鲁棒性,验证了这种协同设计对于将基础模型稳健地适应密集感知任务至关重要。源代码可在 https://github.com/cockmake/ACD-CLIP 获取。

关键词

引用

@article{arxiv.2508.07819,
  title  = {ACD-CLIP: Decoupling Representation and Dynamic Fusion for Zero-Shot Anomaly Detection},
  author = {Ke Ma and Jun Long and Hongxiao Fei and Liujie Hua and Zhen Dai and Yueyi Luo},
  journal= {arXiv preprint arXiv:2508.07819},
  year   = {2026}
}

备注

4 pages, 1 reference, 3 figures