中文

基于多模态注意力增强特征融合的弱监督异常暴力检测

计算机视觉与模式识别 2025-04-07 v1

摘要

弱监督视频异常检测(WS-VAD)是计算机视觉中开发智能监控系统的关键领域。该系统使用三种特征流:RGB视频、光流和音频信号,其中每个流使用增强的注意力模块提取互补的空间和时间特征,以提高检测精度和鲁棒性。在第一个流中,我们采用了一种基于注意力的多阶段特征增强方法来改进RGB视频中的时空特征,其中第一阶段由一个基于ViT的CLIP模块组成,其top-k特征与基于I3D和时序上下文聚合(TCA)的丰富时空特征并行连接。第二阶段使用不确定性调节的双记忆单元(UR-DMU)模型有效捕捉时序依赖性,该模型同时学习正常和异常数据的表示,第三阶段用于选择最相关的时空特征。第二个流利用深度学习和注意力模块的集成,从基于光流数据模态的特征中提取增强的基于注意力的时空特征。音频流使用与VGGish模型集成的注意力模块捕捉听觉线索,旨在基于声音模式检测异常。这些流通过整合仅靠视觉分析无法检测到的、通常指示异常事件的运动和音频信号来丰富模型。多模态融合的串联利用了每种模态的优势,产生了一个全面的特征集,显著提高了在三个数据集上的异常检测精度和鲁棒性。在三个基准数据集上的大量实验和高性能证明了所提出系统相对于现有最先进系统的有效性。

关键词

引用

@article{arxiv.2409.11223,
  title  = {Multimodal Attention-Enhanced Feature Fusion-based Weekly Supervised Anomaly Violence Detection},
  author = {Yuta Kaneko and Abu Saleh Musa Miah and Najmul Hassan and Hyoun-Sup Lee and Si-Woong Jang and Jungpil Shin},
  journal= {arXiv preprint arXiv:2409.11223},
  year   = {2025}
}