中文

通过难度感知GRPO提升MLLMs用于工业异常检测能力

计算机视觉与模式识别 2025-07-30 v1

摘要

工业异常检测(IAD)在维护制造系统的安全和可靠性方面发挥着关键作用。尽管多模态大语言模型(MLLMs)显示出强大的视觉-语言推理能力,但在IAD领域却受限于缺乏领域特定适应。本文提出了EMIT框架,通过难度感知组相对策略优化(GRPO)来增强MLLMs用于IAD。EMIT构建了多任务IAD数据集,并利用GPT生成的物体文本描述来弥补缺失的异常图像。对于少样本异常检测,它集成了软提示和基于热力图引导的对比嵌入,这些嵌入源于基于patch级别的比较。为了更好地处理难以解决的数据样本,即MLLMs难以生成正确答案的情况,我们提出了难度感知GRPO,该方法在原有GRPO基础上引入了响应重抽样策略以确保采样响应中包含正确答案,以及优势重加权机制以加强来自此类难数据样本的学习。大量实验表明,EMIT在MMAD基准上显著提升了MLLMs的IAD性能,在七个任务中相对于基础模型(InternVL3-8B)平均提升了7.77%。

关键词

引用

@article{arxiv.2507.21619,
  title  = {EMIT: Enhancing MLLMs for Industrial Anomaly Detection via Difficulty-Aware GRPO},
  author = {Wei Guan and Jun Lan and Jian Cao and Hao Tan and Huijia Zhu and Weiqiang Wang},
  journal= {arXiv preprint arXiv:2507.21619},
  year   = {2025}
}