中文

VadCLIP:适配视觉-语言模型用于弱监督视频异常检测

计算机视觉与模式识别 2023-12-18 v3 多媒体

摘要

近期对比语言-图像预训练(CLIP)模型在广泛的图像级任务中取得了巨大成功,展现出通过学习具有丰富语义的强大视觉表征的非凡能力。一个开放且值得研究的问题是如何将该强模型高效适配到视频领域并设计鲁棒的视频异常检测器。在本工作中,我们提出 VadCLIP,一种利用冻结 CLIP 模型直接进行弱监督视频异常检测(WSVAD)的新范式,无需任何预训练和微调过程。与当前直接将提取特征输入弱监督分类器进行帧级二分类的工作不同,VadCLIP 借助 CLIP 的优势充分利用视觉与语言之间的细粒度关联,并引入双分支。一个分支简单地利用视觉特征进行粗粒度二分类,而另一个分支充分利用细粒度的语言-图像对齐。得益于双分支,VadCLIP 通过将 CLIP 的预训练知识迁移到 WSVAD 任务,实现了粗粒度和细粒度视频异常检测。我们在两个常用基准上进行了大量实验,表明 VadCLIP 在粗粒度和细粒度 WSVAD 上均取得最佳性能,大幅超越 SOTA 方法。具体而言,VadCLIP 在 XD-Violence 和 UCF-Crime 上分别达到 84.51% AP 和 88.02% AUC。代码和特征发布于 https://github.com/nwpu-zxr/VadCLIP。

关键词

引用

@article{arxiv.2308.11681,
  title  = {VadCLIP: Adapting Vision-Language Models for Weakly Supervised Video Anomaly Detection},
  author = {Peng Wu and Xuerong Zhou and Guansong Pang and Lingru Zhou and Qingsen Yan and Peng Wang and Yanning Zhang},
  journal= {arXiv preprint arXiv:2308.11681},
  year   = {2023}
}

备注

Accept to AAAI2024