中文

从事件提示中学习疑似异常用于视频异常检测

计算机视觉与模式识别 2024-09-04 v2

摘要

大多数弱监督视频异常检测(WS-VAD)模型依赖于多示例学习,旨在不指定异常类型的情况下区分正常和异常片段。然而,不同上下文中异常定义的模糊性可能会在区分异常和正常事件时引入不准确性。为了向模型展示什么是异常,提出了一种新框架来指导从事件提示中学习疑似异常。给定潜在异常事件的文本提示字典和从异常视频中生成的字幕,可以计算它们之间的语义异常相似度,以识别每个视频片段的疑似事件。它实现了一种新的多提示学习过程来约束所有视频的视觉-语义特征,并提供了一种为自训练标注伪异常的新方法。为了证明其有效性,在四个数据集上进行了全面的实验和详细的消融研究,即 XD-Violence、UCF-Crime、TAD 和 ShanghaiTech。我们提出的模型在 AP 或 AUC(86.5%、90.4%、94.4% 和 97.4%)方面优于大多数 SOTA 方法。此外,它在开集和跨数据集情况下也表现出良好的性能。数据、代码和模型可在以下网址找到:\url{https://github.com/shiwoaz/lap}。

关键词

引用

@article{arxiv.2403.01169,
  title  = {Learn Suspected Anomalies from Event Prompts for Video Anomaly Detection},
  author = {Chenchen Tao and Xiaohao Peng and Chong Wang and Jiafei Wu and Puning Zhao and Jun Wang and Jiangbo Qian},
  journal= {arXiv preprint arXiv:2403.01169},
  year   = {2024}
}