SlowFastVAD:通过集成简单检测器和增强型视觉语言模型进行视频异常检测
计算机视觉与模式识别
2025-04-15 v1
摘要
视频异常检测(VAD)旨在识别视频中的异常事件,在安全关键领域具有广泛应用。虽然仅在正常样本上训练的半监督方法日益流行,但往往 suffer from高误报率和解释力差。最近,视觉语言模型(VLM)展示出强大的多模态推理能力,为提供可解释的异常检测提供了新机会。然而,他们的高计算成本和缺乏领域适应性阻碍了实时部署和可靠性。灵感来自人类视觉感知中的双补充路径,我们提出了SlowFastVAD,一种集成快速异常检测器与慢速异常检测器(即增强型视觉语言模型)的混合框架,以解决这些限制。具体而言,快速检测器首先提供粗糙的异常置信度评分,只有一小部分模糊的片段需要进一步由慢速且更具解释力的VLM进行详细检测和推理。此外,为了使VLM适应特定于VAD的场景,我们构建了一个知识库,包括基于少量正常样本的正常模式以及由VLM推断的异常模式。在推理期间,检索相关模式并用于增强异常推理提示。最后,我们平滑地融合快速和慢速检测器的异常置信度,以增强异常检测的鲁棒性。广泛的实验表明,SlowFastVAD有效地结合了快速和慢速检测器的优势,实现了卓越的检测准确性和解释力,同时显著降低了计算开销,使其适用于对可靠性要求高的实际VAD应用。
引用
@article{arxiv.2504.10320,
title = {SlowFastVAD: Video Anomaly Detection via Integrating Simple Detector and RAG-Enhanced Vision-Language Model},
author = {Zongcan Ding and Haodong Zhang and Peng Wu and Guansong Pang and Zhiwei Yang and Peng Wang and Yanning Zhang},
journal= {arXiv preprint arXiv:2504.10320},
year = {2025}
}