中文

LAD-Reasoner:小型多模态模型是逻辑异常检测的优秀推理器

计算机视觉与模式识别 2025-04-18 v1

摘要

近期工业异常检测的进展凸显了需要更深入的逻辑异常分析的需求,即识别和解释对象、计数和空间配置之间意外的关系。现有方法常依赖大规模外部推理模块或复杂的管道设计,限制了实际部署和可解释性。为此,本文提出一种新任务,即推理逻辑异常检测 (RLAD),将逻辑推理纳入传统异常检测之中。我们提出一种新框架 LAD-Reasoner,基于 Qwen2.5-VL 3B 构建的定制小型多模态语言模型。我们的方法采用两阶段训练范式:首先使用监督微调 (SFT) 实现精细的视觉理解,然后通过群体相对策略优化 (GRPO) 优化逻辑异常检测并确保人类可读的推理。关键在于,奖励信号来源于检测准确性和输出结构质量,无需构建链式思维 (CoT) 推理数据。实验在 MVTec LOCO AD 数据集上表明,LAD-Reasoner 虽然规模更小,却在准确率和 F1 分数上与 Qwen2.5-VL-72B 相当,并在生成简洁可解释的理由方面取得优势。这种统一设计减少了对大模型和复杂管道的依赖,同时提供了关于逻辑异常检测的透明和可解释见解。代码和数据将公开发布。

关键词

引用

@article{arxiv.2504.12749,
  title  = {LAD-Reasoner: Tiny Multimodal Models are Good Reasoners for Logical Anomaly Detection},
  author = {Weijia Li and Guanglei Chu and Jiong Chen and Guo-Sen Xie and Caifeng Shan and Fang Zhao},
  journal= {arXiv preprint arXiv:2504.12749},
  year   = {2025}
}