多模态大语言模型能否被引导以提升工业异常检测?
计算机视觉与模式识别
2025-01-28 v1
摘要
在工业环境中,准确检测异常现象对于维护产品质量和确保运营安全至关重要。传统的工业异常检测(Industrial Anomaly Detection,IAD)模型在灵活性和适应性方面往往难以满足,尤其是在新缺陷类型和运营变更频繁出现的动态生产环境中。近期涌现的多模态大语言模型(Multimodal Large Language Models,MLLMs)为克服这些限制提供了前景,通过结合视觉和文本信息处理能力。MLLMs在通用视觉理解方面因在大规模多样数据集上的训练而表现突出,但缺乏行业特定知识,如缺陷容忍度标准,这限制了其在IAD任务中的效能。为此,我们提出Echo,一个新型多专家框架,旨在增强MLLM在IAD中的表现。Echo集成四个专家模块:Reference Extractor通过检索相似正常图像提供情境基线,Knowledge Guide提供领域特定见解,Reasoning Expert实现对复杂查询的结构化、逐步推理,Decision Maker综合所有模块信息,提供精确且情境感知的响应。在MMAD基准测试中,Echo在适应性、精确度和鲁棒性方面均实现显著提升,接近满足实际工业异常检测需求。
引用
@article{arxiv.2501.15795,
title = {Can Multimodal Large Language Models be Guided to Improve Industrial Anomaly Detection?},
author = {Zhiling Chen and Hanning Chen and Mohsen Imani and Farhad Imani},
journal= {arXiv preprint arXiv:2501.15795},
year = {2025}
}
备注
16 pages, 11 figures