中文

不仅看,还要听:弱监督下的多模态暴力检测学习

计算机视觉与模式识别 2020-07-14 v2

摘要

暴力检测在计算机视觉领域已被研究多年。然而,以往的工作要么流于表面,例如对短片段的分类和单一场景,要么供给不足,例如单一模态以及基于手工特征的多模态。为了解决这个问题,在本工作中,我们首先发布了一个名为 XD-Violence 的大规模多场景数据集,总时长 217 小时,包含 4754 个带有音频信号和弱标签的未剪辑视频。然后,我们提出了一个包含三个并行分支的神经网络,以捕获视频片段间的不同关系并整合特征,其中全局分支利用相似性先验捕获长程依赖,局部分支利用邻近性先验捕获局部位置关系,分数分支动态捕获预测分数的紧密程度。此外,我们的方法还包含一个近似器以满足在线检测的需求。我们的方法在我们发布的数据集和其他现有基准上均优于其他 state-of-the-art 方法。此外,大量实验结果也表明了多模态(视听)输入和建模关系的积极作用。代码和数据集将在 https://roc-ng.github.io/XD-Violence/ 发布。

关键词

引用

@article{arxiv.2007.04687,
  title  = {Not only Look, but also Listen: Learning Multimodal Violence Detection under Weak Supervision},
  author = {Peng Wu and Jing Liu and Yujia Shi and Yujia Sun and Fangtao Shao and Zhaoyang Wu and Zhiwei Yang},
  journal= {arXiv preprint arXiv:2007.04687},
  year   = {2020}
}

备注

To appear in ECCV 2020