中文

弱监督视频异常检测的跨模态融合与注意力机制

计算机视觉与模式识别 2024-12-31 v1

摘要

最近, 弱监督视频异常检测 (WS-VAD) 作为一种新兴研究方向, 旨在仅使用视频级别标签识别暴力、裸露等异常事件. 然而, 此任务面临着显著挑战, 包括处理不平衡的模态信息以及持续区分正常与异常特征. 本文提出了一种多模态 WS-VAD 框架, 以准确检测暴力、裸露等异常. 在所提框架中, 我们引入一种新型融合机制, 称为交叉模态融合适配器 (CFA), 其能动态选择并增强与视觉模态高度相关的音频-视觉特征. 此外, 我们引入超bolic Lorentzian Graph Attention (HLGAtt) 以有效捕获正常与异常表示之间的层次关系, 从而提升特征分离精度. 通过大量实验, 我们展示所提模型在暴力和裸露检测基准数据集上实现了最先进的性能.

关键词

引用

@article{arxiv.2412.20455,
  title  = {Cross-Modal Fusion and Attention Mechanism for Weakly Supervised Video Anomaly Detection},
  author = {Ayush Ghadiya and Purbayan Kar and Vishal Chudasama and Pankaj Wasnik},
  journal= {arXiv preprint arXiv:2412.20455},
  year   = {2024}
}

备注

Accepted to CVPR'24 MULA Workshop