深入 CLIP 潜空间用于视频异常识别
计算机视觉与模式识别
2023-10-05 v1
摘要
我们解决在仅使用视频级监督的情况下于帧级别检测和识别监控视频中异常的复杂问题。我们引入新方法 AnomalyCLIP,这是首个将大型语言与视觉(LLV)模型(如 CLIP)与多示例学习相结合以进行联合视频异常检测与分类的方法。我们的方法具体涉及操纵潜 CLIP 特征空间以识别正常事件子空间,这反过来使我们能够有效学习异常事件的文本驱动方向。当异常帧投影到这些方向上时,若其属于某一特定类别则表现出较大的特征幅值。我们还引入了一种计算高效的 Transformer 架构来建模帧间的短期与长期时间依赖,最终产生最终的异常分数与类别预测概率。我们在三个主要异常检测基准(即 ShanghaiTech、UCF-Crime 与 XD-Violence)上将 AnomalyCLIP 与最先进方法进行比较,并凭经验表明其在识别视频异常方面优于基线。
引用
@article{arxiv.2310.02835,
title = {Delving into CLIP latent space for Video Anomaly Recognition},
author = {Luca Zanella and Benedetta Liberatori and Willi Menapace and Fabio Poiesi and Yiming Wang and Elisa Ricci},
journal= {arXiv preprint arXiv:2310.02835},
year = {2023}
}
备注
submitted to Computer Vision and Image Understanding, project website and code are available at https://luca-zanella-dvl.github.io/AnomalyCLIP/