StackCLIP:面向零样本工业异常检测的聚类驱动堆叠提示方法
计算机视觉与模式识别
2025-07-08 v2
摘要
在 CLIP 模型中增强文本与图像特征之间的对齐是零样本工业异常检测任务中的一个关键挑战。现有研究主要在预训练阶段使用特定的类别提示,这可能导致对训练类别的过拟合,从而限制模型的泛化能力。为解决这一问题,我们提出一种通过多类别名称堆叠将类别名称进行转换以生成堆叠提示的方法,并以此构建 StackCLIP 模型。我们的方法引入了两个关键组件。聚类驱动堆叠提示(CSP)模块通过堆叠语义相似的类别来构建通用提示,同时利用多目标文本特征融合来放大相似对象之间的判别性异常。集成特征对齐(EFA)模块针对每个堆叠聚类训练知识专用的线性层,并根据测试类别的属性自适应地集成这些模块。这些模块协同工作,带来了更优的训练速度、稳定性和收敛性,显著提升了异常分割性能。此外,我们的堆叠提示框架在分类任务上具有强大的泛化能力。为进一步提升性能,我们引入了调节提示学习(RPL)模块,该模块利用堆叠提示的泛化能力来优化提示学习,从而提升异常检测分类任务中的结果。在七个工业异常检测数据集上的大量测试表明,我们的方法在零样本异常检测和分割任务中均达到了 state-of-the-art 的性能。
引用
@article{arxiv.2506.23577,
title = {StackCLIP: Clustering-Driven Stacked Prompt in Zero-Shot Industrial Anomaly Detection},
author = {Yanning Hou and Yanran Ruan and Junfa Li and Shanshan Wang and Jianfeng Qiu and Ke Xu},
journal= {arXiv preprint arXiv:2506.23577},
year = {2025}
}