中文

MMAD:面向工业异常检测的多模态大语言模型综合基准

人工智能 2025-02-24 v3 计算机视觉与模式识别

摘要

在工业检查领域,多模态大语言模型(MLLMs)因其强大的语言能力和泛化能力,具有重塑实际应用范式的巨大潜力。然而,尽管这些模型在许多领域展现出惊人的问题解决能力,但其在工业异常检测方面的能力尚未得到系统性研究。为填补这一差距,我们提出了 MMAD,即首个面向工业异常检测的全景 MLLMs 基准测试。我们定义了 MLLMs 在工业检查中七个关键子任务,设计了一种新颖的管线用于生成包含 39,672 个问题的 MMAD 数据集,覆盖 8,366 张工业图像。通过 MMAD,我们对各种最先进的 MLLMs 进行了全面、定量的评估。商业模型表现最佳,GPT-4o 类模型的平均准确率达到 74.9%。然而,这一结果远远不足以满足工业要求。我们的分析揭示,当前 MLLMs 在解答关于工业异常和缺陷的问题方面仍有显著的提升空间。我们进一步探讨了两种无训练性能提升策略,以帮助模型在工业场景中取得改进,凸显了其在未来研究中的前景潜力。

关键词

引用

@article{arxiv.2410.09453,
  title  = {MMAD: A Comprehensive Benchmark for Multimodal Large Language Models in Industrial Anomaly Detection},
  author = {Xi Jiang and Jian Li and Hanqiu Deng and Yong Liu and Bin-Bin Gao and Yifeng Zhou and Jialin Li and Chengjie Wang and Feng Zheng},
  journal= {arXiv preprint arXiv:2410.09453},
  year   = {2025}
}

备注

Accepted by ICLR 2025. The code and data are available at https://github.com/jam-cc/MMAD