VL4AD: 视觉-语言模型提升像素级异常检测
计算机视觉与模式识别
2024-09-27 v1
摘要
语义分割网络在假设数据独立同分布的前提下取得了显著的成功。然而,这些网络常常难以检测来自未知语义类的异常,因为它们通常训练的视觉概念集合有限。为解决此问题,异常分割通常涉及在异常样本上进行微调, necessitating 收集、标注和重新训练数据的额外工作。为避免这一繁琐工作,我们采用不同的方法,提出将视觉-语言(VL) 编码器整合到现有异常检测器中,以利用视觉-语言预训练的语义广度来提高异常意识。此外,我们提出了一种新的评分函数,可通过文本提示实现数据和训练无关的异常监督。 resulting VL4AD 模型包括最大对数概率提示集成和类别合并策略,在广泛使用的基准数据集上实现了具竞争力的性能,从而展示了视觉-语言模型用于像素级异常检测的潜力。
引用
@article{arxiv.2409.17330,
title = {VL4AD: Vision-Language Models Improve Pixel-wise Anomaly Detection},
author = {Liangyu Zhong and Joachim Sicking and Fabian Hüger and Hanno Gottschalk},
journal= {arXiv preprint arXiv:2409.17330},
year = {2024}
}
备注
27 pages, 9 figures, to be published in ECCV 2024 2nd Workshop on Vision-Centric Autonomous Driving (VCAD)