面向多模态异常检测与推理的视觉-语言基础模型定制
计算机视觉与模式识别
2025-05-21 v3 计算与语言
摘要
异常检测在各类工业场景中至关重要,包括识别生产线中的异常模式以及检测制造缺陷以进行质量控制。现有技术往往专用于个别场景,缺乏泛化能力。在本研究中,我们的目标是开发一种可应用于多种场景的通用异常检测模型。为此,我们定制构建了具备广泛知识和强大推理能力的通用视觉语言基础模型,作为异常检测器和推理器。具体而言,我们引入了一种多模态提示策略,将专家的领域知识作为条件来引导模型。我们的方法考虑了多种提示类型,包括任务描述、类别上下文、正常规则和参考图像。此外,我们将多模态的输入表示统一为二维图像格式,从而实现多模态异常检测与推理。我们的初步研究表明,将视觉和语言提示作为条件来定制模型,能够提升异常检测性能。定制后的模型展示了跨不同数据模态(如图像、点云和视频)检测异常的能力。定性案例研究进一步突出了其异常检测与推理能力,特别是在多目标场景和时序数据方面。我们的代码已在 https://github.com/Xiaohao-Xu/Customizable-VLM 公开。
引用
@article{arxiv.2403.11083,
title = {Customizing Visual-Language Foundation Models for Multi-modal Anomaly Detection and Reasoning},
author = {Xiaohao Xu and Yunkang Cao and Huaxin Zhang and Nong Sang and Xiaonan Huang},
journal= {arXiv preprint arXiv:2403.11083},
year = {2025}
}
备注
Best Student Paper Award at IEEE International Conference on Computer Supported Cooperative Work in Design, 2025