视频异常检测的演进:从 DNN 到 MLLM 的统一框架
计算机视觉与模式识别
2025-07-30 v1
摘要
视频异常检测 (VAD) 旨在识别和定位视频中的异常行为或事件,作为智能监控和公共安全领域的核心技术。随着深度学习的发展,深度模型架构的不断演进推动了 VAD 方法的创新,显著提升了特征表征和场景适应能力,从而改善了算法的泛化性并扩展了应用边界。更重要的是,多模态大语言模型 (MLLMs) 和大型语言模型 (LLMs) 的快速发展为 VAD 领域带来了新的机遇和挑战。在 MLLMs 和 LLMs 的支持下,VAD 在数据标注、输入模态、模型架构和任务目标等方面经历了显著变革。大量论文的涌现以及任务的演进造成了对近期进展进行系统性综述的迫切需求。本文提供了首个综合调查,分析基于 MLLMs 和 LLMs 的 VAD 方法,深入讨论了大模型时代 VAD 领域所发生的变更及其背后的原因。此外,本文提出了涵盖基于深度神经网络 (DNN) 和 LLM 方法的统一框架,提供对由 LLMs 赋能的新型 VAD 范式的全面分析,构建了分类体系并比较了其优势与不足。基于此基础上,本文聚焦当前基于 MLLMs/LLMs 的 VAD 方法。最后,基于技术进步的轨迹和现存瓶颈,本文概括出关键挑战,勾勒出未来研究方向,为 VAD 社区提供指导。
引用
@article{arxiv.2507.21649,
title = {The Evolution of Video Anomaly Detection: A Unified Framework from DNN to MLLM},
author = {Shibo Gao and Peipei Yang and Haiyang Guo and Yangyang Liu and Yi Chen and Shuai Li and Han Zhu and Jian Xu and Xu-Yao Zhang and Linlin Huang},
journal= {arXiv preprint arXiv:2507.21649},
year = {2025}
}