AnyAnomaly:基于大型视觉语言模型的零样态可定制视频异常检测
计算机视觉与模式识别
2025-12-08 v4
摘要
视频异常检测(VAD)是计算机视觉中至关重要的任务,但现有VAD模型依赖学习到的正常模式,难以适用于多样化环境。用户需为新环境重新训练模型或开发独立AI模型,这需要机器学习专业知识、高性能硬件和大量数据收集,限制了VAD的实际可用性。为此,本研究提出可定制视频异常检测(C-VAD)技术和AnyAnomaly模型。C-VAD将用户定义的文本视为异常事件,在视频中检测包含指定事件的帧。我们通过无需微调大型视觉语言模型即可实现上下文感知的视觉问答,从而有效实现AnyAnomaly。为验证所提方法的有效性,我们构建了C-VAD数据集并展示了AnyAnomaly的优势。此外,我们的方法在VAD基准测试中表现出竞争力,在UBnormal和UCF-Crime上实现最先进性能,并在所有数据集上显示出优于其他方法的泛化能力。我们的代码已在github.com/SkiddieAhn/Paper-AnyAnomaly上线。
引用
@article{arxiv.2503.04504,
title = {AnyAnomaly: Zero-Shot Customizable Video Anomaly Detection with LVLM},
author = {Sunghyun Ahn and Youngwan Jo and Kijung Lee and Sein Kwon and Inpyo Hong and Sanghyun Park},
journal= {arXiv preprint arXiv:2503.04504},
year = {2025}
}
备注
Accepted to WACV 2026