一个无语言基础模型足以实现通用视觉异常检测
计算机视觉与模式识别
2026-01-12 v1
摘要
通用视觉异常检测(AD)旨在遵循零样本和少样本范式,无需任何数据集特定的微调,面向开放和动态场景识别异常图像并分割异常区域。我们见证了近期方法中视觉-语言基础模型的广泛应用取得了显著进展。然而,当前方法常受限于复杂的提示工程、精细的适配模块和具有挑战性的训练策略,最终限制了其灵活性和通用性。为解决这些问题,本文重新思考了用于 AD 的视觉-语言模型背后的基本机制,并提出了一个极其简单、通用且有效的通用视觉异常检测框架(UniADet)。具体而言,我们首先发现语言编码器被用于推导异常分类和分割的决策权重,然后证明这对于通用 AD 是不必要的。其次,我们提出了一种极其简单的方法,将分类与分割完全解耦,并解耦跨层级特征,即为不同任务和层级特征学习独立的权重。UniADet 在涵盖工业和医学领域的 14 个真实世界 AD 基准上,表现出高度简单(仅学习解耦权重)、参数高效(仅 0.002M 可学习参数)、通用(适配多种基础模型)和有效(首次以大幅优势超越最先进的零/少样本甚至全样本 AD 方法)的特性。我们将在 https://github.com/gaobb/UniADet 公开 UniADet 的代码和模型。
引用
@article{arxiv.2601.05552,
title = {One Language-Free Foundation Model Is Enough for Universal Vision Anomaly Detection},
author = {Bin-Bin Gao and Chengjie Wang},
journal= {arXiv preprint arXiv:2601.05552},
year = {2026}
}
备注
20 pages, 5 figures, 34 tabels