中文

迈向基于视觉与语言基础模型的无训练异常检测

计算机视觉与模式识别 2025-03-25 v1

摘要

异常检测在工业质量检测等实际应用中具有重要价值。然而,现有方法大多聚焦于检测局部结构异常,而忽略了结合逻辑约束的组合异常。本文提出 LogSAD,一种用于逻辑与结构异常检测的无训练多模态框架。首先,我们提出一种 match-of-thought 架构,利用先进的大型多模态模型(即 GPT-4V)生成匹配提议,构建用于异常检测的兴趣与组合规则。其次,我们设计了多粒度异常检测机制,由 patch token、兴趣集合以及基于视觉与语言基础模型的组合匹配组成。随后,我们提出一个校准模块以对齐来自不同检测器的异常分数,并通过集成策略给出最终决策。因此,我们的方法在统一框架内同时处理逻辑异常与结构异常,且无需任何训练即可取得当前最优结果,即便与有监督方法相比亦不逊色,展现出良好的鲁棒性与有效性。代码已开源:https://github.com/zhang0jhon/LogSAD。

关键词

引用

@article{arxiv.2503.18325,
  title  = {Towards Training-free Anomaly Detection with Vision and Language Foundation Models},
  author = {Jinjin Zhang and Guodong Wang and Yizhou Jin and Di Huang},
  journal= {arXiv preprint arXiv:2503.18325},
  year   = {2025}
}

备注

Accepted to CVPR 2025