基于自诱导视觉 Transformer 的可泛化工业视觉异常检测
计算机视觉与模式识别
2022-11-30 v3
摘要
工业视觉异常检测在先进智能制造过程中起着关键作用,但在此背景下仍有一些局限有待解决。首先,现有基于重建的方法受困于平凡捷径的恒等映射,其中正常与异常样本间的重建误差差距明显,导致检测能力不佳。其次,以往研究主要集中于捕获物体局部语义而忽略全局上下文的卷积神经网络(CNN)模型,同样导致性能不佳。此外,现有研究遵循独立学习模式,检测模型仅能处理一类产品,而多类别的可泛化检测尚未被探索。为应对上述局限,我们提出了一种自诱导视觉 Transformer(SIVT)用于无监督可泛化多类别工业视觉异常检测与定位。所提 SIVT 首先从预训练 CNN 提取判别性特征作为属性描述子。然后,提出自诱导视觉 Transformer 以自监督方式重建所提取特征,其中额外引入辅助诱导令牌以诱导原始信号的语义。最后,可利用语义特征残差差异检测异常属性。我们在现有 Mvtec AD 基准上实验了 SIVT,结果显示所提方法以 AUROC 提升 2.8-6.3、AP 提升 3.3-7.6 推进了最先进检测性能。
引用
@article{arxiv.2211.12311,
title = {Generalizable Industrial Visual Anomaly Detection with Self-Induction Vision Transformer},
author = {Haiming Yao and Wenyong Yu},
journal= {arXiv preprint arXiv:2211.12311},
year = {2022}
}
备注
8 pages, 6 figures,