中文

Triad:通过视觉专家引导的视觉分词器与制造工艺赋能基于 LMM 的异常检测

计算机视觉与模式识别 2025-08-13 v2

摘要

尽管最近的方法试图将大型多模态模型引入工业异常检测(IAD),但它们在 IAD 领域的泛化能力远不及通用领域。我们将造成这一差距的主要原因总结为两个方面。一方面,通用 LMM 缺乏对视觉模态中缺陷的认知,从而无法充分聚焦于缺陷区域。因此,我们提出修改 LLaVA 模型的 AnyRes 结构,将现有 IAD 模型识别出的潜在异常区域提供给 LMM。另一方面,现有方法主要通过学习缺陷模式或与正常样本比较来识别缺陷,但它们无法理解这些缺陷的成因。考虑到缺陷的产生与制造工艺密切相关,我们提出了一种制造驱动的 IAD 范式。我们设计了用于 IAD 的指令微调数据集和结合制造的思维链数据组织方法,以利用制造工艺进行 IAD。基于上述两项修改,我们提出了 Triad,一种结合专家引导的感兴趣区域分词器和制造工艺、基于 LMM 的工业异常检测新方法。大量实验表明,我们的 Triad 不仅在与当前 LMM 的对比中表现出有竞争力的性能,而且在结合制造工艺后实现了进一步的准确率提升。源代码、训练数据和预训练模型将在 https://github.com/tzjtatata/Triad 公开提供。

关键词

引用

@article{arxiv.2503.13184,
  title  = {Triad: Empowering LMM-based Anomaly Detection with Vision Expert-guided Visual Tokenizer and Manufacturing Process},
  author = {Yuanze Li and Shihao Yuan and Haolin Wang and Qizhang Li and Ming Liu and Chen Xu and Guangming Shi and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2503.13184},
  year   = {2025}
}