记忆增强的在线视频异常检测
计算机视觉与模式识别
2025-06-19 v2 人工智能
摘要
理解周围场景的能力对自动驾驶车辆(AVs)至关重要。本文提出一种能够以在线方式工作、在AV周围异常出现时立即响应的系统,仅利用仪表盘挂载摄像头捕获的视频。我们的架构称为MOVAD,依赖两个主要模块:用于提取正在进行动作相关信息的短期记忆模块,由Video Swin Transformer(VST)实现;以及注入分类器的长期记忆模块,借助长短期记忆(LSTM)网络考虑遥远的过去信息与动作上下文。MOVAD的优势不仅在于其优异性能,还在于其简洁模块化架构,以端到端方式仅用RGB帧训练且假设尽可能少,易于实现与调试。我们在交通事故检测(DoTA)数据集上评估了方法性能,该数据集为具挑战性的仪表盘摄像头事故视频集合。经过充分消融研究,MOVAD达到82.17%的AUC分数,以+2.87 AUC超越当前最优(SOTA)。我们的代码将发布于 https://github.com/IMPLabUniPr/movad/tree/movad_vad
引用
@article{arxiv.2302.10719,
title = {Memory-augmented Online Video Anomaly Detection},
author = {Leonardo Rossi and Vittorio Bernuzzi and Tomaso Fontanini and Massimo Bertozzi and Andrea Prati},
journal= {arXiv preprint arXiv:2302.10719},
year = {2025}
}