JUDO:面向工业异常问答的并置领域导向多模态推理器
计算机视觉与模式识别
2026-05-21 v1 人工智能
机器学习
摘要
大型多模态模型(LMMs)极大地推动了工业异常检测,使其能够处理检测之外的多样化人类指令,特别是通过视觉基础推理实现更好的图像理解。然而,LMMs缺乏领域特定知识,这限制了它们在复杂工业场景中生成准确响应的能力。在这项工作中,我们提出了JUDO(并置领域导向多模态推理器),一个在视觉和文本推理中有效整合领域知识和上下文的框架。通过视觉推理,我们的模型通过将查询图像与正常图像作为视觉领域上下文进行并置来分割缺陷区域,从而实现细粒度的视觉比较检查。此外,我们通过监督微调(SFT)注入领域知识以增强上下文理解,随后通过强化学习(GRPO)和定制奖励引导领域推理,选择领域导向的推理过程。实验结果表明,JUDO在MMAD基准上取得了优越的性能,超越了Qwen2.5-VL-7B和GPT-4o等模型。这些结果强调了增强领域知识和上下文对于异常理解中有效推理的重要性。
引用
@article{arxiv.2605.20284,
title = {JUDO: A Juxtaposed Domain-Oriented Multimodal Reasoner for Industrial Anomaly QA},
author = {Hyunju Kang and Woohyun Lee and Jaewon Kim and Hogun Park},
journal= {arXiv preprint arXiv:2605.20284},
year = {2026}
}
备注
Published at ICLR 2026