中文

分析基于 VLM 的异常分类与分割方法

计算机视觉与模式识别 2026-01-21 v1

摘要

视觉语言模型,特别是 CLIP,通过在无需大量标注数据集的情况下实现零样本和少样本缺陷识别,彻底改变了异常检测领域。通过学习图像和文本的对齐表示,VLM 能够利用正常和异常状态的自然语言描述来进行异常分类和分割,从而消除了对特定任务训练或缺陷样本的传统要求。本项目对基于 VLM 的异常分类(AC)和异常分割(AS)方法进行了全面分析。我们系统地研究了关键的架构范式,包括基于滑动窗口的密集特征提取、带有可学习投影的多阶段特征对齐(AprilLab 框架)以及组合式提示集成策略。我们的分析在关键维度上评估了这些方法:特征提取机制、文本-视觉对齐策略、提示工程技术、零样本与少样本的权衡、计算效率以及跨域泛化能力。通过在 MVTec AD 和 VisA 等基准上的严格实验,我们比较了分类准确率、分割精度和推理效率。主要贡献在于对 VLM 如何以及为何在异常检测中取得成功提供了基础性理解,综合了用于方法选择的实用见解,并指出了当前的局限性。这项工作旨在促进基于 VLM 的方法在工业质量控制中的知情采用,并为未来的研究方向提供指导。

关键词

引用

@article{arxiv.2601.13440,
  title  = {Analyzing VLM-Based Approaches for Anomaly Classification and Segmentation},
  author = {Mohit Kakda and Mirudula Shri Muthukumaran and Uttapreksha Patel and Lawrence Swaminathan Xavier Prince},
  journal= {arXiv preprint arXiv:2601.13440},
  year   = {2026}
}

备注

10 pages,4 images