文本引导的多模态统一工业异常检测
计算机视觉与模式识别
2026-04-28 v1
摘要
基于 RGB-3D 多模态数据的工业异常检测已成为智能质量检查的主流范式。然而,现有无监督方法存在两个关键局限性:因缺乏高层语义指导导致的跨模态对齐模糊,以及对 RGB 到 3D 特征映射不足的几何建模。为解决这些问题,我们提出一种由文本语义引导的统一多模态工业异常检测框架。该框架包含两个核心模块:几何感知跨模态映射器用于在模态转换过程中保留几何结构,以及对象条件文本特征适配器用于将多模态特征与语义先验对齐。此外,我们建立了一种用于多模态工业异常检测的统一学习范式,该范式打破了一个模型一个类别的约束,使单个模型能够对 diverse classes 实现精准异常检测。在 MVTec 3D-AD 和 Eyecandies 数据集上的大量实验表明,我们的方法在无监督设置下在分类和定位方面实现了最先进的性能。
引用
@article{arxiv.2604.22899,
title = {Text-Guided Multimodal Unified Industrial Anomaly Detection},
author = {Zewen Li and Shuo Ye and Zitong Yu and Weicheng Xie and Linlin Shen},
journal= {arXiv preprint arXiv:2604.22899},
year = {2026}
}
备注
12 pages