弱监督下语言引导的开放世界视频异常检测
计算机视觉与模式识别
2026-03-04 v3
摘要
视频异常检测(VAD)旨在检测偏离预期的事件。在开放世界场景中,预期事件可能随着需求的变化而改变。例如,在流感爆发期间不戴口罩可能被视为异常,而在其他情况下则被视为正常。然而,现有方法假设异常的定义是不变的,因此不适用于开放世界。为了解决这一问题,我们提出了一种具有可变定义的新型开放世界 VAD 范式,允许在推理时通过用户提供的自然语言进行引导检测。这种范式需要建立从视频和文本定义到异常分数的稳健映射。因此,我们提出了 LaGoVAD(Language-guided Open-world Video Anomaly Detector),这是一个在弱监督下通过两种正则化策略动态调整异常定义的模型:通过动态视频合成多样化异常的相对持续时间,以及通过带有负样本挖掘的对比学习增强特征鲁棒性。训练此类自适应模型需要多样化的异常定义,但现有数据集通常只提供标签而没有语义描述。为了弥合这一差距,我们收集了 PreVAD(Pre-training Video Anomaly Dataset),这是迄今为止最大且最多样化的视频异常数据集,包含 35,279 个带有明确异常定义的多级类别标签和描述的标注视频。在七个数据集上的零样本实验证明了 LaGoVAD 的 SOTA 性能。我们的数据集和代码发布于 https://github.com/Kamino666/LaGoVAD-PreVAD。
引用
@article{arxiv.2503.13160,
title = {Language-guided Open-world Video Anomaly Detection under Weak Supervision},
author = {Zihao Liu and Xiaoyu Wu and Jianqin Wu and Xuxu Wang and Linlin Yang},
journal= {arXiv preprint arXiv:2503.13160},
year = {2026}
}
备注
Accepted by ICLR 2026