中文

基于级联视觉语言模型的实时视频异常检测:Cerberus

计算机视觉与模式识别 2025-10-21 v1 计算与语言

摘要

视频异常检测(VAD)通过近期视觉语言模型(VLM)的发展取得了快速进展。尽管这些模型提供了出色的零样检测能力,但其巨大的计算成本和不稳定的视觉 grounding 性能阻碍了实时部署。为克服这些挑战,我们引入 Cerberus,一个为高效且准确的实时 VAD 设计的两阶段级联系统。Cerberus 在离线学习正常行为规则后,在在线推理中结合轻量级过滤和细粒度 VLM 推理。Cerberus 的性能提升源于两个关键创新:运动掩码提示和基于规则的偏差检测。前者引导 VLM 注意力聚焦于与运动相关的区域,后者将异常识别为从已学习规范的偏差,而非枚举可能的异常。广泛的评估表明,Cerberus 在 NVIDIA L40S GPU 上平均实现 57.68 fps,加速 151.79 倍,准确率达 97.2%,相当于最新的 VLM-based VAD 方法,构成实时视频分析的实用解决方案。

关键词

引用

@article{arxiv.2510.16290,
  title  = {Cerberus: Real-Time Video Anomaly Detection via Cascaded Vision-Language Models},
  author = {Yue Zheng and Xiufang Shi and Jiming Chen and Yuanchao Shu},
  journal= {arXiv preprint arXiv:2510.16290},
  year   = {2025}
}