MMVIAD:面向工业异常检测的多视角多任务视频理解
计算机视觉与模式识别
2026-05-12 v1 人工智能
摘要
工业异常检测对于制造质量控制至关重要,但现有数据集主要聚焦静态图像或稀疏视角,未充分反映真实工业场景中持续检查的过程。我们引入MMVIAD(Multi-view Multi-task Video Industrial Anomaly Detection),据称是首个持续性多视角视频数据集用于工业异常检测与理解,同时提供多任务评估基准。MMVIAD包含约120度相机运动的、以对象为中心的2秒检查片段,覆盖48类对象、14种环境和6种结构异常类型。它支持异常检测、缺陷分类、对象分类和异常可见时间局部化。对MMVIAD上的系统评估显示,当前商业和开源视频 MLLM 在精细缺陷识别和时间定位方面远不如人类水平。为提高可迁移的异常理解能力,我们进一步开发了两个阶段的后训练管道:PS-SFT(Perception-Structured Supervised Fine-Tuning)初始化感知结构推理,VISTA-GRPO(Visibility-grounded Industrial Structured Temporal Anomaly Group Relative Policy Optimization)采用语义门控缺陷奖励和可见性感知时间奖励进行模型微调,生成最终模型VISTA。在MMVIAD-Unseen上,VISTA将基模型在四个任务上的平均得分从45.0提升至57.5,超过GPT-5.4。源代码可在 https://github.com/Georgekeepmoving/MMVIAD 获取。
引用
@article{arxiv.2605.10833,
title = {MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection},
author = {Xiran Zhao and Jing Jin and Yan Bai and Zhongan Wang and Yifeng Sun and Yihang Lou and Xuanyu Zhu and Tao Feng and Yingna Wu},
journal= {arXiv preprint arXiv:2605.10833},
year = {2026}
}