中文

先对齐后融合:一种新型弱监督多模态暴力检测方法

计算机视觉与模式识别 2025-03-17 v2

摘要

弱监督暴力检测指的是仅使用视频级别标签训练模型以识别视频中暴力片段的技术。在此类方法中,集成音频和光流等模态的多模态暴力检测具有巨大的潜力。现有方法主要致力于设计多模态融合模型以解决模态间的差异。在 contrast,我们采取不同方法;充分利用暴力事件表示中各模态之间的内在差异,提出一种新型多模态语义特征对齐方法。该方法稀疏地将局部、瞬时且信息较少的模态(如音频和光流)映射到更具信息的 RGB 语义特征空间。通过迭代过程,该方法识别适当的非零特征匹配子空间,并基于此子空间对模态特定的事件表示进行对齐,从而在后续模态融合阶段充分利用来自所有模态的信息。在此基础上,我们设计了一个新的弱监督暴力检测框架,包括单模态多实例学习用于提取单模态语义特征、多模态对齐、多模态融合和最终检测。实验结果表明,我们的方法在基准数据集上有效, 在 XD-Violence 数据集上实现了 86.07% 的平均精度 (AP)。我们的代码已公开于 https://github.com/xjpp2016/MAVD。

关键词

引用

@article{arxiv.2501.07496,
  title  = {Aligning First, Then Fusing: A Novel Weakly Supervised Multimodal Violence Detection Method},
  author = {Wenping Jin and Li Zhu and Jing Sun},
  journal= {arXiv preprint arXiv:2501.07496},
  year   = {2025}
}