中文

基于大语言模型的视频异常检测与解释

计算机视觉与模式识别 2024-01-12 v1

摘要

视频异常检测(Video Anomaly Detection, VAD)旨在定位长程监控视频时间线上的异常事件。基于异常评分的方法多年来一直占据主导地位,但存在阈值设定复杂度高和检测结果可解释性低的问题。本文率先开展了将视频大语言模型(Video-based Large Language Models, VLLMs)引入VAD框架的研究,使VAD模型摆脱阈值依赖,并能够解释检测到的异常原因。我们引入了一种新颖的网络模块——长程上下文(Long-Term Context, LTC),以缓解VLLMs在长程上下文建模方面的不足。我们设计了一种三阶段训练方法,通过大幅降低对VAD数据的需求和标注指令微调数据的成本,来提高微调VLLMs的效率。我们训练得到的模型在UCF-Crime和TAD基准的异常视频上取得了顶尖性能,AUC分别提升了+3.86%和+4.96%。更令人瞩目的是,我们的方法能够为检测到的异常提供文本解释。

关键词

引用

@article{arxiv.2401.05702,
  title  = {Video Anomaly Detection and Explanation via Large Language Models},
  author = {Hui Lv and Qianru Sun},
  journal= {arXiv preprint arXiv:2401.05702},
  year   = {2024}
}

备注

9 pages, 6 figures