中文

Holmes-VAD:基于多模态大语言模型的无偏且可解释视频异常检测

计算机视觉与模式识别 2024-07-02 v2

摘要

针对开放式视频异常检测 (VAD),现有方法在面对具有挑战性或未见事件时常表现出偏置,并缺乏可解释性。为此,我们提出了 Holmes-VAD,一种新型框架,利用精确的时间监督和丰富的多模态指令,实现准确的异常局部分辨和全面解释。首先,在构建无偏且可解释的 VAD 系统方面,我们构建了首个大规模多模态 VAD 指令调优基准数据集,即 VAD-Instruct50k。该数据集采用精心设计的半自动标注范式创建。对收集的非裁剪视频应用高效的单帧标注,然后通过稳健的即插即用视频描述器和大语言模型 (LLM) 将其合成为对异常和正常视频剪辑的高质量分析。在 VAD-Instruct50k 数据集基础上,我们开发了针对可解释视频异常检测的定制解决方案。我们训练一个轻量级时间抽样器,以选择高异常响应的帧,并微调多模态大语言模型 (LLM) 以生成解释性内容。大量实验结果表明,所提出的 Holmes-VAD 在通用性和可解释性方面均表现出色,为实际的视频异常分析 establish 为一种新型可解释技术。为支持社区,我们的基准和模型将在 https://holmesvad.github.io 公开。

关键词

引用

@article{arxiv.2406.12235,
  title  = {Holmes-VAD: Towards Unbiased and Explainable Video Anomaly Detection via Multi-modal LLM},
  author = {Huaxin Zhang and Xiaohao Xu and Xiang Wang and Jialong Zuo and Chuchu Han and Xiaonan Huang and Changxin Gao and Yuehuan Wang and Nong Sang},
  journal= {arXiv preprint arXiv:2406.12235},
  year   = {2024}
}

备注

19 pages, 9 figures