中文

学习成为 Transformer 以精确定位异常

计算机视觉与模式识别 2025-06-27 v3

摘要

为了高效部署常用预训练特征提取器,最近的工业异常检测和分割 (IADS) 方法会处理低分辨率图像,例如 224x224 像素的图像,通过对原始输入图像进行下采样获得。然而,尽管众多工业应用需要识别大型和小型缺陷,但将输入图像下采样到低分辨率可能会阻碍方法精确定位微小异常的能力。我们提出了一种新颖的 Teacher-Student 范式来利用强大的预训练特征,同时以非常高的效率处理高分辨率输入图像。核心思想是通过正常图像训练两个浅层 MLP (Student),以模仿由冻结的视觉 Transformer (Teacher) 的自注意力层所产生的 patch 嵌入之间的映射。事实上,学习这些映射构成一个具有挑战性的预文本任务,小容量模型不太可能在分布之外的数据(例如异常图像)上完成。我们的方法可以从高分辨率图像中识别异常,速度远快于竞争方法,在 MVTec AD 和 VisA 上实现了最先进的性能。我们还提出了新的评估指标来捕捉对缺陷大小的鲁棒性,即从大型异常到小型异常保持良好局部定位的能力。通过这些指标评估我们的方法也揭示了其出色的性能。

关键词

引用

@article{arxiv.2407.04092,
  title  = {Learning to Be a Transformer to Pinpoint Anomalies},
  author = {Alex Costanzino and Pierluigi Zama Ramirez and Giuseppe Lisanti and Luigi Di Stefano},
  journal= {arXiv preprint arXiv:2407.04092},
  year   = {2025}
}

备注

Accepted at IEEE Access