中文

Vi-SAFE:面向公共监控的高效暴力检测空间-时间框架

计算机视觉与模式识别 2025-09-17 v1

摘要

公共监控暴力检测对于公共安全至关重要。本研究解决小目标、复杂环境及实时时序分析等挑战问题。提出Vi-SAFE框架,集成增强型YOLOv8与时序段网络(TSN)用于视频监控。YOLOv8模型采用GhostNetV3作为轻量级主干网络,引入指数移动平均(EMA)注意力机制,并进行剪枝以降低计算成本同时保持精度。YOLOv8与TSN分别在行人数据集和暴力数据集上独立训练,YOLOv8用于提取人体区域,TSN用于暴力行为的二分类。在RWF-2000数据集上的实验表明,Vi-SAFE达到0.88的准确率,显著优于TSN单独的0.77准确率,并在准确率与效率上超越现有方法,证明其在公共安全监控中的有效性。代码已公开于https://anonymous.4open.science/r/Vi-SAFE-3B42/README.md。

关键词

引用

@article{arxiv.2509.13210,
  title  = {Vi-SAFE: A Spatial-Temporal Framework for Efficient Violence Detection in Public Surveillance},
  author = {Ligang Chang and Shengkai Xu and Liangchang Shen and Binhan Xu and Junqiao Wang and Tianyu Shi and Yanhui Du},
  journal= {arXiv preprint arXiv:2509.13210},
  year   = {2025}
}