中文

EventVAD:基于事件感知的无训练视频异常检测

计算机视觉与模式识别 2025-07-29 v3

摘要

视频异常检测 (VAD) 旨在识别视频中的异常。监督式方法需要大量领域内训练数据,常难以泛化到未见的异常。相比之下,无训练方法利用大语言模型 (LLM) 的内在世界知识进行检测,但在局部细粒度视觉过渡和多样化事件定位方面面临挑战。因此,我们提出了 EventVAD,一种基于事件感知的视频异常检测框架,结合针对性的动态图 architecture 与多模态 LLM,通过时序-事件推理实现。具体而言,EventVAD 首先采用带时衰减约束的动态时空图建模,以捕获事件感知的视频特征。随后进行自适应噪声滤波,并通过信号比阈值检测事件边界。统计边界检测模块降低了处理长视频对 MLLM 的复杂度,并通过事件一致性提高其时序推理能力。最后,使用分层提示策略引导 MLLM 进行推理后确定最终决策。在 UCF-Crime 和 XD-Violence 数据集上进行了广泛实验。结果表明,采用 7B MLLM 的 EventVAD 在无训练设置下实现了状态突破 (SOTA),显著优于使用 7B 或更大规模 MLLM 的强大基准方法。

关键词

引用

@article{arxiv.2504.13092,
  title  = {EventVAD: Training-Free Event-Aware Video Anomaly Detection},
  author = {Yihua Shao and Haojin He and Sijie Li and Siyu Chen and Xinwei Long and Fanhu Zeng and Yuxuan Fan and Muyang Zhang and Ziyang Yan and Ao Ma and Xiaochen Wang and Hao Tang and Yan Wang and Shuyan Li},
  journal= {arXiv preprint arXiv:2504.13092},
  year   = {2025}
}

备注

Paper was accepted by ACM MM 2025; Code: https://github.com/YihuaJerry/EventVAD