AVadCLIP:用于鲁棒视频异常检测的音视频协作
计算机视觉与模式识别
2025-06-03 v2
摘要
随着视频异常检测在智能监控领域的不断采用,传统的基于视觉的检测方法在复杂环境下常面临信息不足和高误报率的问题。为此,我们提出了一个新型弱监督框架,利用音视频协作实现鲁棒的视频异常检测。我们利用Contrastive Language-Image Pretraining(CLIP)在视觉、音频和文本领域的卓越跨模态表示学习能力,构建了该框架,引入了两个主要创新点:一种高效的音视频融合方法,通过轻量级参数适应性地实现跨模态集成,同时保持冻结的CLIP主干网络;以及一种新颖的音视频提示符,基于音视频特征与文本标签之间的语义相关性,动态地增强文本嵌入中的关键多模态信息,显著提高了CLIP在视频异常检测任务上的泛化能力。此外,为增强对推理期间模态缺失的鲁棒性,我们进一步开发了一个基于不确定性驱动的特征蒸馏模块,用于从视觉输入合成音视频表示。该模块基于音视频特征的多样性进行不确定性建模,在蒸馏过程中动态强调具有挑战性的特征。我们的框架在多个基准测试上表现出优异性能,音频集成显著提高了各种场景下的异常检测准确率。值得注意的是,经过不确定性驱动的单模态数据增强,我们的方法在一致上优于当前的单模态VAD方法。
引用
@article{arxiv.2504.04495,
title = {AVadCLIP: Audio-Visual Collaboration for Robust Video Anomaly Detection},
author = {Peng Wu and Wanshun Su and Guansong Pang and Yujia Sun and Qingsen Yan and Peng Wang and Yanning Zhang},
journal= {arXiv preprint arXiv:2504.04495},
year = {2025}
}
备注
12 pages, 6 figures, 9 tables. This work has been submitted to the IEEE for possible publication