中文

开放词汇视频异常检测

计算机视觉与模式识别 2024-03-14 v3

摘要

弱监督视频异常检测(VAD)在利用视频级标签判别视频帧正常或异常方面已取得显著性能。然而,当前方法固有地受限于闭集设定,在测试数据中存在训练时未见的异常类别的开放世界应用中可能表现不佳。少数近期研究试图处理更现实的设定——开放集 VAD,旨在给定已见异常与正常视频的情况下检测未见异常。但此类设定侧重于预测帧异常分数,不具备识别异常具体类别的能力,尽管该能力对构建更智能的视频监控系统至关重要。本文更进一步探索开放词汇视频异常检测(OVVAD),旨在利用预训练大模型检测并分类已见与未见异常。为此,我们提出一种将 OVVAD 解耦为两个互为补充的任务——类无关检测与类特定分类——并联合优化二者的模型。特别地,我们设计语义知识注入模块,从大语言模型引入语义知识用于检测任务;并设计新颖异常合成模块,借助大视觉生成模型为分类任务生成伪未见异常视频。这些语义知识与合成异常大幅扩展了模型检测和分类多种已见与未见异常的能力。在三个广泛使用的基准上的大量实验表明,我们的模型在 OVVAD 任务上达到了最先进性能。

关键词

引用

@article{arxiv.2311.07042,
  title  = {Open-Vocabulary Video Anomaly Detection},
  author = {Peng Wu and Xuerong Zhou and Guansong Pang and Yujia Sun and Jing Liu and Peng Wang and Yanning Zhang},
  journal= {arXiv preprint arXiv:2311.07042},
  year   = {2024}
}

备注

Accepted to CVPR2024