用于弱监督视频异常检测的基于正常性引导的文本提示
计算机视觉与模式识别
2024-04-15 v1
摘要
弱监督视频异常检测(WSVAD)是一项具有挑战性的任务。基于弱标签生成细粒度伪标签,然后对分类器进行自训练,目前是一种很有前景的解决方案。然而,由于现有方法仅使用 RGB 视觉模态而忽略了类别文本信息的利用,从而限制了更准确伪标签的生成并影响了自训练的性能。受基于事件描述的人工标注过程的启发,本文提出了一种用于 WSVAD 的基于正常性引导的文本提示(TPWNG)的新型伪标签生成与自训练框架。我们的想法是迁移对比语言-图像预训练(CLIP)模型丰富的语言-视觉知识,以对齐视频事件描述文本和相应的视频帧来生成伪标签。具体而言,我们首先通过设计两个排序损失和一个分布不一致损失来微调 CLIP 以进行领域自适应。进一步,我们在正常性视觉提示的辅助下提出一种可学习的文本提示机制,以进一步提高视频事件描述文本与视频帧的匹配准确度。然后,我们设计了一个基于正常性引导的伪标签生成模块,以推断可靠的帧级伪标签。最后,我们引入了一个时序上下文自适应学习模块,以更灵活、准确地学习不同视频事件的时序依赖关系。大量实验表明,我们的方法在 UCF-Crime 和 XD-Violence 两个基准数据集上取得了 SOTA 的性能。
引用
@article{arxiv.2404.08531,
title = {Text Prompt with Normality Guidance for Weakly Supervised Video Anomaly Detection},
author = {Zhiwei Yang and Jing Liu and Peng Wu},
journal= {arXiv preprint arXiv:2404.08531},
year = {2024}
}
备注
Accepted to CVPR2024