中文

学习提示增强的上下文特征用于弱监督视频异常检测

计算机视觉与模式识别 2024-01-24 v2

摘要

弱监督下的视频异常检测面临显著挑战,特别是在训练期间缺乏帧级标注。尽管先前研究利用图卷积网络与自注意力机制,并结合基于多示例学习(MIL)的分类损失来建模时间关系并学习判别性特征,这些方法常采用多分支架构分别捕捉局部与全局依赖,导致参数与计算成本增加。此外,基于 MIL 损失的二值约束所提供的粗粒度类间可分性忽视了异常类内部的细粒度判别性。为此,本文引入一种弱监督异常检测框架,聚焦于高效上下文建模与增强的语义判别性。我们提出时间上下文聚合(TCA)模块,通过复用相似度矩阵并实现自适应融合来捕捉全面上下文信息。此外,我们提出提示增强学习(PEL)模块,利用基于知识的提示整合语义先验,以提升上下文特征的判别能力同时确保异常子类间的可分性。大量实验验证了该方法各组件的有效性,在 UCF-Crime、XD-Violence 和 ShanghaiTech 三个具挑战性基准上以更少参数与计算量取得具竞争力的性能。值得注意的是,我们的方法显著提升了某些异常子类的检测精度,凸显其实用价值与效能。我们的代码见:https://github.com/yujiangpu20/PEL4VAD。

关键词

引用

@article{arxiv.2306.14451,
  title  = {Learning Prompt-Enhanced Context Features for Weakly-Supervised Video Anomaly Detection},
  author = {Yujiang Pu and Xiaoyu Wu and Lulu Yang and Shengjin Wang},
  journal= {arXiv preprint arXiv:2306.14451},
  year   = {2024}
}

备注

13 pages, 9 figures