基于离散潜在空间遮盖图像建模的逻辑异常检测
计算机视觉与模式识别
2026-03-16 v2
摘要
检测如对象组合错误或位置偏离等异常现象是无监督异常检测中的一个具有挑战性的问题。由于常规异常检测方法主要关注正常图像的局部模式,因而在检测那些出现于全局模式中的逻辑异常方面存在困难。为有效检测这些具有挑战性的逻辑异常,我们引入了逻辑异常检测与遮盖图像建模(LADMIM),这是一种新的无监督异常检测框架,运用了遮盖图像建模和离散表示学习的强大能力。我们的核心洞察是,预测缺失区域的任务迫使模型学习到图像中不同块与块之间的长程依赖关系。具体而言,我们将异常检测问题形式化为遮盖区域预测离散潜在分布的任务。由于离散潜在分布对像素空间的低层方差不变,模型可以更理想地专注于图像中的逻辑依赖关系,从而提高逻辑异常检测的准确性。我们在五个基准数据集上评估了异常检测性能,结果表明该方法在不使用任何预训练分割模型的情况下即可实现相当的性能。我们还进行了全面的实验,以揭示影响逻辑异常检测性能的关键因素。
引用
@article{arxiv.2410.10234,
title = {LADMIM: Logical Anomaly Detection with Masked Image Modeling in Discrete Latent Space},
author = {Shunsuke Sakai and Tatushito Hasegawa and Makoto Koshino},
journal= {arXiv preprint arXiv:2410.10234},
year = {2026}
}
备注
Accepted at TMLR2025. Code is available at https://github.com/SkyShunsuke/LADMIM