中文

JOSENet:用于监控视频暴力检测的联合流嵌入网络

计算机视觉与模式识别 2024-08-06 v2 图像与视频处理

摘要

视频监控摄像头的日益普及以及日益增长的犯罪预防需求,加剧了研究界对暴力检测任务的兴趣。与其他动作识别任务相比,监控视频中的暴力检测存在额外问题,例如真实打斗场景的多样性。不幸的是,与其他动作识别任务的数据集相比,现有的暴力检测数据集相对较小。此外,监控画面通常每个视频中出现不同个体,每个摄像头背景也不同。此外,在现实监控视频中快速检测暴力行为对于防止不良后果至关重要,因此需要优化内存使用和计算成本的模型。这些挑战使得传统动作识别方法的应用变得复杂。为了解决所有这些问题,我们引入了JOSENet,一种新颖的自监督框架,为监控视频中的暴力检测提供了出色的性能。所提出的模型处理两个时空视频流,即RGB帧和光流,并融入了一种新的正则化自监督学习方法用于视频。JOSENet相比最先进的方法表现出改进的性能,同时每个视频片段仅使用四分之一的帧,并以较低的帧率运行。源代码可在https://github.com/ispamm/JOSENet获取。

关键词

引用

@article{arxiv.2405.02961,
  title  = {JOSENet: A Joint Stream Embedding Network for Violence Detection in Surveillance Videos},
  author = {Pietro Nardelli and Danilo Comminiello},
  journal= {arXiv preprint arXiv:2405.02961},
  year   = {2024}
}