利用大型语言模型实现免训练视频异常检测
计算机视觉与模式识别
2024-04-02 v1
摘要
视频异常检测(VAD)旨在对视频中的异常事件进行时间定位。现有工作大多依赖于训练深度模型,在视频级监督、单类监督或无监督设置下学习正常分布。基于训练的方法容易受限于特定领域,因此在实际部署中成本高昂,因为任何领域变化都需要数据收集和模型训练。在本文中,我们从根本上脱离了以往的努力,提出了基于语言的VAD(LAVAD),这是一种以新颖的、免训练范式处理VAD的方法,利用了预训练大型语言模型(LLMs)和现有视觉语言模型(VLMs)的能力。我们利用基于VLM的字幕模型为任何测试视频的每一帧生成文本描述。有了文本场景描述,我们随后设计了一种提示机制,以解锁LLMs在时间聚合和异常分数估计方面的能力,将LLMs转变为有效的视频异常检测器。我们进一步利用模态对齐的VLMs,并提出了基于跨模态相似度的有效技术,用于清洗噪声字幕和细化基于LLM的异常分数。我们在两个具有真实世界监控场景的大型数据集(UCF-Crime和XD-Violence)上评估了LAVAD,结果表明,在不需要任何训练或数据收集的情况下,它优于无监督和单类方法。
引用
@article{arxiv.2404.01014,
title = {Harnessing Large Language Models for Training-free Video Anomaly Detection},
author = {Luca Zanella and Willi Menapace and Massimiliano Mancini and Yiming Wang and Elisa Ricci},
journal= {arXiv preprint arXiv:2404.01014},
year = {2024}
}
备注
CVPR 2024. Project website at https://lucazanella.github.io/lavad/