KAnoCLIP:通过知识驱动的提示学习和增强跨模态集成实现零样态异常检测
计算机视觉与模式识别
2025-01-08 v1
摘要
零样态异常检测 (ZSAD) 在缺乏目标数据集训练样本的场景中识别异常现象,这对于面临隐私问题或数据有限的情境至关重要。视觉-语言模型如 CLIP 在 ZSAD 中显示出潜力,但存在局限性:依赖手动构建的固定文本描述或异常提示耗时且易产生语义歧义,CLIP 在像素级异常分割方面走弱,侧重全局语义而非局部细节。为此,我们引入 KAnoCLIP,一种新型 ZSAD 框架,利用视觉-语言模型。KAnoCLIP 通过知识驱动的提示学习 (KnPL) 整合大型语言模型 (GPT-3.5) 中的通用知识和视觉问题 answering 系统 (Llama3) 中针对图像的细粒度知识。KnPL 使用知识驱动 (KD) 损失函数创建可学习的异常提示,无需固定文本提示,提升了泛化能力。KAnoCLIP 包含 CLIP 视觉编码器的 V-V 注意力 (CLIP-VV)、面向多级跨模态交互的双向跨注意力 (Bi-CMCI) 以及 Conv-Adapter。这些组件保留局部视觉语义,改进局部跨模态融合,将全局视觉特征与文本信息对齐,从而提升像素级异常检测性能。KAnoCLIP 在 12 个工业和医疗数据集上实现了零样态异常检测的状态最佳性能,显示出对现有方法的优越泛化能力。
引用
@article{arxiv.2501.03786,
title = {KAnoCLIP: Zero-Shot Anomaly Detection through Knowledge-Driven Prompt Learning and Enhanced Cross-Modal Integration},
author = {Chengyuan Li and Suyang Zhou and Jieping Kong and Lei Qi and Hui Xue},
journal= {arXiv preprint arXiv:2501.03786},
year = {2025}
}
备注
Accepted by ICASSP 2025