CLIP-TSA:用于弱监督视频异常检测的CLIP辅助时间自注意力
计算机视觉与模式识别
2023-07-06 v3
摘要
视频异常检测(VAD)——由于其劳动密集型特性,通常以弱监督方式表述为多示例学习问题——是视频监控中一个具有挑战性的问题,其目标是在未裁剪视频中定位异常帧。在本文中,我们首先提出利用CLIP的ViT编码视觉特征,而非该领域传统的C3D或I3D特征,以在新方法中高效提取判别性表示。随后,我们通过所提出的时间自注意力(TSA)建模时间依赖关系并提名感兴趣片段。消融实验证实了TSA与ViT特征的有效性。大量实验表明,我们提出的CLIP-TSA在VAD问题中三个常用基准数据集(UCF-Crime、ShanghaiTech Campus和XD-Violence)上大幅优于现有的最先进(SOTA)方法。我们的源代码发布于 https://github.com/joos2010kj/CLIP-TSA。
引用
@article{arxiv.2212.05136,
title = {CLIP-TSA: CLIP-Assisted Temporal Self-Attention for Weakly-Supervised Video Anomaly Detection},
author = {Hyekang Kevin Joo and Khoa Vo and Kashu Yamazaki and Ngan Le},
journal= {arXiv preprint arXiv:2212.05136},
year = {2023}
}
备注
Published at the 30th IEEE International Conference on Image Processing (IEEE ICIP 2023)