借助语言模态引导提升视觉异常检测
计算机视觉与模式识别
2023-10-05 v1 人工智能
摘要
近年来,异常检测在解决工业缺陷检测、事件检测等任务上引起大量关注。然而,现有的无监督异常检测器,尤其是视觉模态的检测器,因冗余信息与稀疏潜空间而面临重大挑战。相反,语言模态因其数据相对单一而表现良好。本文从多模态视角解决视觉模态的上述挑战。具体而言,我们提出跨模态引导(CMG),其由跨模态熵约简(CMER)与跨模态线性嵌入(CMLE)组成,分别应对冗余信息与稀疏空间问题。CMER 掩蔽原始图像的部分区域并计算与文本的匹配分数,随后丢弃无关像素使检测器聚焦于关键内容。为学习更紧凑的视觉异常检测器潜空间,CMLE 从语言模态学习相关结构矩阵,进而在该矩阵引导下学习视觉模态的潜空间。此后,视觉潜空间将使语义相似图像更靠近。大量实验证明了所提方法的有效性。特别地,CMG 比仅使用图像的基线高出 16.81%。消融实验进一步证实了所提方法间的协同作用,各组件依赖彼此以实现最优性能。
引用
@article{arxiv.2310.02821,
title = {Improving Vision Anomaly Detection with the Guidance of Language Modality},
author = {Dong Chen and Kaihang Pan and Guoming Wang and Yueting Zhuang and Siliang Tang},
journal= {arXiv preprint arXiv:2310.02821},
year = {2023}
}
备注
9 pages, 10 figures