中文

MoniTor:利用指令驱动的大语言模型进行在线视频异常检测

计算机视觉与模式识别 2025-10-27 v1

摘要

视频异常检测(VAD)旨在定位视频中的异常活动或行为.最近,离线 VAD 因大语言模型(LLM)和视觉语言模型(VLM)的进展而受到广泛关注,其为更细致的异常理解提供了潜力.然而,由于实时约束和计算密集性,在线 VAD 鲜有关注.本文引入一种 novel Memory-based online scoring queue scheme for Training-free VAD(MoniTor),以解决在线 VAD 的内在复杂性.具体而言,MoniTor 将流式输入应用于 VLMs,利用大规模预训练模型的能力.为更有效地捕获时序依赖性,我们包含一种 novel prediction mechanism,灵感来自长短期记忆(LSTM)网络.这确保模型能够有效地建模过去的状态并利用先前的预测来识别异常行为,从而更好地理解当前帧.此外,我们设计了一个评分队列和异常先验,用于动态存储最近的评分并覆盖监控场景中的所有异常,为 LLMs 在时间上区分正常与异常行为提供指导.我们在两个大型数据集(即UCF-Crime和XD-Violence)上对 MoniTor 进行了评估,这些数据集包含各种监控和真实场景.结果表明,MoniTor 在性能上优于最新方法,且在无需训练的情况下与弱监督方法具有竞争力.代码已公开于 https://github.com/YsTvT/MoniTor.

关键词

引用

@article{arxiv.2510.21449,
  title  = {MoniTor: Exploiting Large Language Models with Instruction for Online Video Anomaly Detection},
  author = {Shengtian Yang and Yue Feng and Yingshi Liu and Jingrou Zhang and Jie Qin},
  journal= {arXiv preprint arXiv:2510.21449},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025. The first two authors hold equal contributions