中文

FiLo++: 基于融合细粒度描述与可变形定位的零/少样本异常检测

计算机视觉与模式识别 2026-03-03 v2

摘要

异常检测方法通常需要来自目标类别的大量正常样本进行训练,限制了其在快速适应场景(如冷启动)中的应用。零样本和少样本异常检测不需提前获取目标类别的标记样本,因而成为具有前景的研究方向。现有零样本和少样本方法常利用强大多模态模型通过比较图像-文本相似度来检测并定位异常,但其手工设计的通用描述难以捕捉不同对象中可能出现的多样化异常,而简单的基于patch级别的图像-文本匹配也常难以定位形状和尺寸各异的异常区域。为此,本文提出FiLo++方法,包含两个关键组件。第一个组件,即融合细粒度描述(FusDes),利用大语言模型生成每个对象类别的异常描述,结合固定和可学习的提示模板,并应用运行时提示过滤方法,产生更精确且任务特定的文本描述。第二个组件,即可变形定位(DefLoc),将视觉基础模型Grounding DINO与位置增强文本描述及多尺度可变形跨模态交互(MDCI)模块集成,实现对形状和尺寸各异的异常的精确定位。此外,我们设计了位置增强的patch匹配方法,以提升少样本异常检测性能。实验在多个数据集上表明,FiLo++相较于现有方法实现了显著的性能提升。代码将于https://github.com/CASIA-IVA-Lab/FiLo发布。

关键词

引用

@article{arxiv.2501.10067,
  title  = {FiLo++: Zero-/Few-Shot Anomaly Detection by Fused Fine-Grained Descriptions and Deformable Localization},
  author = {Zhaopeng Gu and Bingke Zhu and Guibo Zhu and Yingying Chen and Ming Tang and Jinqiao Wang},
  journal= {arXiv preprint arXiv:2501.10067},
  year   = {2026}
}