基于YOLO-World和时空深度学习的人类中心异常检测:用于监视视频
计算机视觉与模式识别
2025-10-28 v1 人工智能
摘要
监视视频中的异常检测仍是一个具有挑战性的任务,由于异常事件的多样性、类别不平衡以及场景依赖的视觉杂乱。为此,我们提出一种集成人类中心预处理与时空建模的稳健深度学习框架,用于多类异常分类。我们的管道首先应用YOLO-World——一种开放词汇视觉语言检测器——识别原始视频剪辑中的人类实例,随后使用ByteTrack进行一致的身份感知跟踪。通过对检测边界框之外的背景区域应用高斯模糊,有效减少场景特定的干扰,使模型聚焦于行为相关的前景内容。经过精炼的帧随后被处理为使用ImageNet预训练的InceptionV3网络进行空间特征提取,时序动态则使用双向LSTM(BiLSTM)进行序列级分类。我们在UCF-Crime数据集的五类子集(Normal, Burglary, Fighting, Arson, Explosion)上进行评估,实现了在三个独立试验中的平均测试准确率为92.41%,且每个类别的F1分数均超过0.85。综合评估指标——包括混淆矩阵、ROC曲线以及宏/加权平均——显示出强大的泛化能力和对类别不平衡的韧性。结果确认,前景聚焦的预处理显著增强了现实世界监视场景中的异常判别能力。
关键词
引用
@article{arxiv.2510.22056,
title = {Human-Centric Anomaly Detection in Surveillance Videos Using YOLO-World and Spatio-Temporal Deep Learning},
author = {Mohammad Ali Etemadi Naeen and Hoda Mohammadzade and Saeed Bagheri Shouraki},
journal= {arXiv preprint arXiv:2510.22056},
year = {2025}
}