中文

从帧到事件:人类中心视频异常检测评估的重新思考

计算机视觉与模式识别 2026-04-13 v1

摘要

基于姿态的视频异常检测 (VAD) 因其隐私保护特性和对环境变化的鲁棒性而受到广泛关注。然而,传统的帧级评估将视频视为独立帧的集合,这在根本上与异常如何发生及如何被实际操作应对的方式不符。在实际监控系统中,重要的并非对单个帧的标记,而是对连贯异常事件的可靠检测、局部化和报告——具有可识别起点和持续时间的连续时序情节。帧级指标对这一区别毫无了解,导致其在需要可操作事件级警报的部署中系统性地高估模型性能。本文提出将 VAD 视角从帧级转向事件级。我们首先审查了广泛使用的 VAD 数据集基准(包括 SHT[19]、CHAD[6]、NWPUC[4] 和 HuVAD[25]),以描绘其事件结构。随后,我们引入两种时序事件局部化策略:一种是带有层次高斯平滑和自适应二值化的得分细化管道,另一种是直接生成事件级检测的端到端双分支模型。最终,我们通过采用基于时间动作局部化指标(包括基于 tIoU 的事件匹配和多阈值 F1 评估),建立了 VAD 的首个事件基准评估标准。我们的结果量化了 substantial performance gap:尽管所有最先进模型在 NWPUC[4] 上实现的帧级 AUC-ROC 超过 52%,但其事件级局部化精度在最小 tIoU=0.2 时仍低于 10%,且在所有阈值下的平均事件级 F1 仅为 0.11。该工作的代码库已公开于 https://github.com/TeCSAR-UNCC/EventCentric-VAD。

关键词

引用

@article{arxiv.2604.09327,
  title  = {From Frames to Events: Rethinking Evaluation in Human-Centric Video Anomaly Detection},
  author = {Narges Rashvand and Shanle Yao and Armin Danesh Pazho and Babak Rahimi Ardabili and Hamed Tabkhi},
  journal= {arXiv preprint arXiv:2604.09327},
  year   = {2026}
}