中文

基于深度学习的音视频融合方法用于提升人类动作识别与暴力检测

计算机视觉与模式识别 2024-08-06 v1 机器学习 多媒体 图像与视频处理

摘要

本文提出一种基于混合融合的深度学习方法,利用两种不同模态(音频和视频)来提高公共场所的人类活动识别和暴力检测效果。为了充分利用音视频融合,本文采用后期融合、中间融合和混合融合基于深度学习(HFBDL)方法进行比较。由于目标是检测和识别公共场所的人类暴力行为,本文扩展并使用了真实暴力情境(RLVS)数据集。HFBDL 模型在验证数据上实现了96.67%的准确率,显著优于该数据集上其他最先进的方法。为了展示模型在实际场景中的能力,本文记录了54个包含暴力和非暴力情境的视频。该模型成功地正确检测了52个视频。该方法在实际场景中表现出色,可用于公共场所的人类动作识别和暴力检测。

关键词

引用

@article{arxiv.2408.02033,
  title  = {Enhancing Human Action Recognition and Violence Detection Through Deep Learning Audiovisual Fusion},
  author = {Pooya Janani and Amirabolfazl Suratgar and Afshin Taghvaeipour},
  journal= {arXiv preprint arXiv:2408.02033},
  year   = {2024}
}

备注

This work has been submitted to the IEEE for possible publication, 10 pages, 8 figures