图像级监督下的推理驱动异常检测与定位
计算机视觉与模式识别
2026-03-31 v1
摘要
多模态大语言模型(MLLM)近期在异常检测中展现了显著的推理与感知能力。然而,大多数方法仍局限于图像级异常检测与文本推理,而像素级定位仍依赖外部视觉模块和密集标注。在本工作中,我们激活了MLLM的内在推理潜力,仅从图像级监督出发,无需任何辅助组件或像素级标签,即可执行异常检测、像素级定位和可解释推理。具体而言,我们提出了推理驱动异常定位(ReAL),它从自回归推理过程中提取异常相关标记,并聚合其注意力响应以生成像素级异常图。我们进一步引入了一致性引导推理优化(CGRO)模块,利用强化学习将推理标记与视觉注意力对齐,从而实现更连贯的推理和更准确的异常定位。在四个公开基准上的广泛实验表明,我们的方法显著提升了异常检测、定位和可解释性。值得注意的是,尽管仅依赖图像级监督,我们的方法在性能上达到了与在密集像素级监督下训练的MLLM方法相当的水平。代码可在https://github.com/YizhouJin313/ReADL获取。
引用
@article{arxiv.2603.27179,
title = {Reasoning-Driven Anomaly Detection and Localization with Image-Level Supervision},
author = {Yizhou Jin and Yuezhu Feng and Jinjin Zhang and Peng Wang and Qingjie Liu and Yunhong Wang},
journal= {arXiv preprint arXiv:2603.27179},
year = {2026}
}
备注
Accepted to CVPR 2026