Holmes-VAD:基于多模态大语言模型的无偏且可解释视频异常检测
计算机视觉与模式识别
2024-07-02 v2
摘要
针对开放式视频异常检测 (VAD),现有方法在面对具有挑战性或未见事件时常表现出偏置,并缺乏可解释性。为此,我们提出了 Holmes-VAD,一种新型框架,利用精确的时间监督和丰富的多模态指令,实现准确的异常局部分辨和全面解释。首先,在构建无偏且可解释的 VAD 系统方面,我们构建了首个大规模多模态 VAD 指令调优基准数据集,即 VAD-Instruct50k。该数据集采用精心设计的半自动标注范式创建。对收集的非裁剪视频应用高效的单帧标注,然后通过稳健的即插即用视频描述器和大语言模型 (LLM) 将其合成为对异常和正常视频剪辑的高质量分析。在 VAD-Instruct50k 数据集基础上,我们开发了针对可解释视频异常检测的定制解决方案。我们训练一个轻量级时间抽样器,以选择高异常响应的帧,并微调多模态大语言模型 (LLM) 以生成解释性内容。大量实验结果表明,所提出的 Holmes-VAD 在通用性和可解释性方面均表现出色,为实际的视频异常分析 establish 为一种新型可解释技术。为支持社区,我们的基准和模型将在 https://holmesvad.github.io 公开。
引用
@article{arxiv.2406.12235,
title = {Holmes-VAD: Towards Unbiased and Explainable Video Anomaly Detection via Multi-modal LLM},
author = {Huaxin Zhang and Xiaohao Xu and Xiang Wang and Jialong Zuo and Chuchu Han and Xiaonan Huang and Changxin Gao and Yuehuan Wang and Nong Sang},
journal= {arXiv preprint arXiv:2406.12235},
year = {2024}
}
备注
19 pages, 9 figures