中文

AnoViT:基于视觉Transformer编码器-解码器的无监督异常检测与定位

计算机视觉与模式识别 2022-03-22 v1 机器学习

摘要

图像异常检测问题旨在判断图像是否异常并检测异常区域。这些方法广泛应用于制造、医疗和智能信息等多个领域。编码器-解码器结构因能在无监督学习环境下轻松学习正常模式,并通过表示输入与重建图像差异的重建误差计算识别异常的分数,而在异常检测领域被广泛使用。因此,当前图像异常检测方法普遍采用卷积编码器-解码器,通过图像的局部特征提取正常信息。然而,由于使用固定大小滤波器的卷积操作特性,其局限在于构建正常表示时仅能利用图像的局部特征。为此,我们提出一种基于视觉 transformer 的编码器-解码器模型 AnoViT,旨在通过额外学习图像块间的全局关系来反映正常信息,其能够同时进行图像异常检测与定位。所提方法利用通过多个自注意力层的所有图像块嵌入,构建保持各图像块原有位置信息的特征图。所提 AnoViT 模型在三个基准数据集上优于基于卷积的模型。在异常定位代表性基准数据集 MVTecAD 上,与基线相比其在 15 个类别中的 10 个上显示出改进结果。此外,定性评估定位结果时,所提方法在不同类别和异常区域类型下均表现出良好性能。

关键词

引用

@article{arxiv.2203.10808,
  title  = {AnoViT: Unsupervised Anomaly Detection and Localization with Vision Transformer-based Encoder-Decoder},
  author = {Yunseung Lee and Pilsung Kang},
  journal= {arXiv preprint arXiv:2203.10808},
  year   = {2022}
}