中文

视觉-语言模型辅助的无监督视频异常检测

计算机视觉与模式识别 2024-09-27 v2

摘要

由于视频异常检测在计算机视觉应用中的关键作用,它已成为工业界和学术界广泛关注的重要课题。然而,异常的固有不可预测性和异常样本的稀缺性给无监督学习方法带来了重大挑战。为了克服无监督学习因缺乏关于异常的全面先验知识而产生的局限性,我们提出了 VLAVAD(视频-语言模型辅助异常检测)。我们的方法采用跨模态预训练模型,利用大语言模型 (LLMs) 的推理能力,并结合选择性提示适配器 (SPA) 来选择语义空间。此外,我们引入了序列状态空间模块 (S3M),用于检测语义特征中的时间不一致性。通过将高维视觉特征映射到低维语义特征,我们的方法显著增强了无监督异常检测的可解释性。我们提出的方法有效解决了检测在长时间段内难以辨别的隐蔽异常的挑战,在具有挑战性的 ShanghaiTech 数据集上达到了 SOTA。

关键词

引用

@article{arxiv.2409.14109,
  title  = {Vision-Language Models Assisted Unsupervised Video Anomaly Detection},
  author = {Yalong Jiang and Liquan Mao},
  journal= {arXiv preprint arXiv:2409.14109},
  year   = {2024}
}