基于多阶段推理与细粒度奖励优化的异常检测多模态 LLM
计算机视觉与模式识别
2025-08-07 v1
摘要
尽管多模态大语言模型(MLLM)在 diverse 领域展现出惊人的能力,但其应用于专门的异常检测(AD)仍受限于 domain adaptation 挑战。现有的基于 Group Relative Policy Optimization(GRPO)的方法存在两个关键局限:当模型产生均匀响应时数据利用不足,以及缺乏对推理过程的监督,鼓励模型在不经过深思熟虑分析的情况下直接做出二分决定。我们提出了综合框架,通过两种协同创新来解决这些局限。首先,我们引入多阶段深思熟虑推理过程,引导模型从区域识别到聚焦检查,生成对 GRPO 优化至关重要的多样化响应模式,同时实现对分析工作流程的结构化监督。其次,我们发展了细粒度奖励机制,融合分类准确率和定位监督,将二分反馈转化为连续信号,以区分真正的分析洞见与不实之 correctness。广泛的评估表明,我们的方法在适应 general vision-language 模型以检测微妙制造缺陷和结构异常方面显著提升了性能。我们的技术以高效整合现有标注实现卓越准确率,有效弥合了通用 MLLM 能力与检测细粒度视觉差异之间的鸿沟。
引用
@article{arxiv.2508.04175,
title = {AD-FM: Multimodal LLMs for Anomaly Detection via Multi-Stage Reasoning and Fine-Grained Reward Optimization},
author = {Jingyi Liao and Yongyi Su and Rong-Cheng Tu and Zhao Jin and Wenhao Sun and Yiting Li and Dacheng Tao and Xun Xu and Xulei Yang},
journal= {arXiv preprint arXiv:2508.04175},
year = {2025}
}