EIAD: 基于多模态大语言模型的可解释工业异常检测
人工智能
2025-05-19 v2
摘要
工业异常检测(IAD)对确保制造过程中的产品质量至关重要。尽管现有的零样本缺陷分割和检测方法已显示出有效性,但它们无法提供缺陷的详细描述。此外,多模态大模型在IAD中的应用仍处于起步阶段,在平衡问答(QA)性能和基于掩码的定位能力方面面临挑战,这通常是由于微调过程中的过拟合所致。为了解决这些挑战,我们提出了一种新方法,引入专门的多模态缺陷定位模块,将对话功能与核心特征提取解耦。这种解耦通过独立的优化目标和定制化的学习策略实现。此外,我们贡献了首个多模态工业异常检测训练数据集——缺陷检测问答(DDQA),涵盖了广泛的缺陷类型和工业场景。与依赖GPT生成数据的传统数据集不同,DDQA确保了真实性和可靠性,为模型训练提供了坚实基础。实验结果表明,所提出的方法——可解释工业异常检测助手(EIAD)——在缺陷检测和定位任务中取得了出色表现。它不仅显著提升了准确性,还改善了可解释性。这些进展凸显了EIAD在工业实际应用中的潜力。
引用
@article{arxiv.2503.14162,
title = {EIAD: Explainable Industrial Anomaly Detection Via Multi-Modal Large Language Models},
author = {Zongyun Zhang and Jiacheng Ruan and Xian Gao and Ting Liu and Yuzhuo Fu},
journal= {arXiv preprint arXiv:2503.14162},
year = {2025}
}
备注
Accepted by ICME2025