基于时空提示的弱监督视频异常检测与定位
计算机视觉与模式识别
2024-08-14 v2 人工智能
摘要
当前弱监督视频异常检测(WSVAD)任务旨在仅利用粗糙的视频级别注释实现帧级异常事件检测。已有工作通常涉及从全分辨率视频帧中提取全局特征并训练帧级分类器以在时间维度上检测异常。然而,大多数异常事件发生在局部空间区域而非整个视频帧中,这表明基于帧级特征的现有工作可能受到主导背景信息的误导,缺乏对检测异常的解释。为解决这一困境,本文提出了一种新方法,称为 STPrompt,它基于预训练的视觉语言模型(VLMs)学习时空提示嵌入,用于弱监督视频异常检测与定位(WSVADL)。我们采用两流网络结构,其中一流侧重于时间维度,另一流侧主要关注空间维度。通过利用从预训练 VLMs 中学习到的知识,并整合来自原始视频的自然运动先验,我们的模型学习到与视频时空区域(例如单个帧的图块)对齐的提示嵌入,以识别异常的特定局部区域,实现对视频异常的精确检测,同时减轻背景信息的影响。无需依赖详细的时空注释或辅助对象检测/跟踪,我们的方法在三个公开基准数据集上实现了 WSVADL 任务的最新性能。
引用
@article{arxiv.2408.05905,
title = {Weakly Supervised Video Anomaly Detection and Localization with Spatio-Temporal Prompts},
author = {Peng Wu and Xuerong Zhou and Guansong Pang and Zhiwei Yang and Qingsen Yan and Peng Wang and Yanning Zhang},
journal= {arXiv preprint arXiv:2408.05905},
year = {2024}
}
备注
Accepted by ACMMM2024