中文

探索用于多类无监督异常检测的纯 ViT 重建方法

计算机视觉与模式识别 2024-08-13 v2

摘要

本工作研究了一个具有挑战性且实用的问题,即多类无监督异常检测 (MUAD)。该问题仅需正常图像进行训练,同时测试多个类别的正常和异常图像。现有的基于重建的方法通常采用金字塔网络作为编码器和解码器以获取多分辨率特征,这通常涉及大量手工工程的复杂子模块。相比之下,展示更直接架构的纯 Vision Transformer (ViT) 已在包括检测和分割任务在内的多个领域证明有效。它更简单、更有效且更优雅。秉承这一精神,我们探索仅使用纯 ViT 特征进行 MUAD。我们首先通过综合当前的基于重建的方法,抽象出一个 Meta-AD 概念。随后,我们从全局和局部视角逐步设计并实例化了一种新颖的基于 ViT 的 ViTAD 结构。该模型提供了强大的基线,以促进未来的研究。此外,本文揭示了几个值得进一步研究的有趣发现。最后,我们使用八项指标对各种方法进行了全面且公平的基准测试。仅使用 MSE 损失的基础训练方案,ViTAD 在 MVTec AD、VisA 和 Uni-Medical 数据集上取得了 SOTA 结果与效率。\Eg,在 MVTec AD 数据集上达到 85.4 mAD,比 UniAD 高出 +3.0,且仅需 1.1 小时和 2.3G GPU 显存即可在单张 V100 上完成模型训练,可作为强大的基线以促进未来研究的发展。完整代码可在 https://zhangzjn.github.io/projects/ViTAD/ 获取。

关键词

引用

@article{arxiv.2312.07495,
  title  = {Exploring Plain ViT Reconstruction for Multi-class Unsupervised Anomaly Detection},
  author = {Jiangning Zhang and Xuhai Chen and Yabiao Wang and Chengjie Wang and Yong Liu and Xiangtai Li and Ming-Hsuan Yang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2312.07495},
  year   = {2024}
}