中文

面向少样本异常检测的细粒度视觉语言对齐

计算机视觉与模式识别 2025-10-31 v1

摘要

少样本异常检测(Few-shot Anomaly Detection,FSAD)方法通过少量已知正常样本识别异常区域。大多数现有方法依赖预训练视觉语言模型(vision-language models,VLMs)的泛化能力,通过文本描述与图像之间的特征相似性识别潜在异常区域。然而,由于缺乏详细的文本描述,这些方法只能预定义图像级描述,将每个视觉块标记与图像匹配,以识别潜在异常区域,导致图像描述与块级视觉异常之间存在语义错位,实现异常区域定位性能有限。为此,我们提出多级细粒度语义标题(Multi-Level Fine-Grained Semantic Caption,MFSC),为现有异常检测数据集提供多级细粒度文本描述,并构建自动化构建管道。基于 MFSC,我们提出新型框架 FineGrainedAD 以提高异常定位性能,包含两个组件:多级可学习提示(Multi-Level Learnable Prompt,MLLP)和多级语义对齐(Multi-Level Semantic Alignment,MLSA)。MLLP 通过自动替换和拼接机制将细粒度语义引入多级可学习提示,而 MLSA 设计区域聚合策略和多级对齐训练,以促进可学习提示更好地与相应视觉区域对齐。实验表明,所提出的 FineGrainedAD 在 MVTec-AD 和 VisA 数据集上在少样本设置下实现整体优异性能。

关键词

引用

@article{arxiv.2510.26464,
  title  = {Towards Fine-Grained Vision-Language Alignment for Few-Shot Anomaly Detection},
  author = {Yuanting Fan and Jun Liu and Xiaochen Chen and Bin-Bin Gao and Jian Li and Yong Liu and Jinlong Peng and Chengjie Wang},
  journal= {arXiv preprint arXiv:2510.26464},
  year   = {2025}
}

备注

12 pages, 7 figures