中文

M2S2L:用于视频异常检测的基于 Mamba 的多尺度时空学习

计算机视觉与模式识别 2025-11-11 v1

摘要

视频异常检测(VAD)是图像处理领域中的一项重要任务,在视频监控中具有广阔前景,但在平衡检测精度与计算效率方面面临根本性挑战。随着视频内容日益复杂,包含多样的行为模式和上下文场景,传统 VAD 方法难以对现代监控系统提供稳健的评估。现有方法要么缺乏全面的时空建模,要么需要过多的计算资源而无法用于实时应用。为此,本文提出了一种基于 Mamba 的多尺度时空学习(M2S2L)框架。该方法采用在多种粒度上操作的分层空间编码器,以及在不同时间尺度上捕捉运动动态的多时间编码器。我们还引入了特征分解机制,以实现针对外观和运动重建的特定任务优化,从而促进更细致的行为建模和质量感知的异常评估。在三个基准数据集上的实验表明,M2S2L 框架在 UCSD Ped2、CUHK Avenue 和 ShanghaiTech 上分别实现了 98.5%、92.1% 和 77.9% 的帧级 AUC,同时保持了 20.1G FLOPs 和 45 FPS 推理速度的效率,使其适用于实际的监控部署。

关键词

引用

@article{arxiv.2511.05564,
  title  = {M2S2L: Mamba-based Multi-Scale Spatial-temporal Learning for Video Anomaly Detection},
  author = {Yang Liu and Boan Chen and Xiaoguang Zhu and Jing Liu and Peng Sun and Wei Zhou},
  journal= {arXiv preprint arXiv:2511.05564},
  year   = {2025}
}

备注

IEEE VCIP 2025