中文

完形填空有帮助:通过学会补全视频事件实现有效的视频异常检测

计算机视觉与模式识别 2020-08-28 v1 机器学习 图像与视频处理

摘要

作为媒体内容理解中的重要课题,视频异常检测(VAD)通过深度神经网络(DNN)已取得丰硕进展。然而,现有方法通常遵循重建或帧预测惯例。它们存在两个缺陷:(1)无法以既精确又全面的方式定位视频活动。(2)缺乏利用高层语义与 temporal context 信息的充足能力。受语言学习中常用的完形填空启发,我们提出一种全新的 VAD 解决方案,称为视频事件补全(VEC)以弥补上述缺陷:首先,我们提出一种新颖流程,以实现对视频活动既精确又全面的包围。外观与运动被用作相互补充的线索来定位感兴趣区域(RoIs)。从每个 RoI 构建归一化时空立方体(STC)作为视频事件,其为 VEC 奠定基础并作为基本处理单元。其次,我们通过求解视觉完形填空来鼓励 DNN 捕捉高层语义。为构建此类视觉完形填空,擦除 STC 的某一块以产生不完整事件(IE)。DNN 通过推断缺失块来从 IE 恢复原始视频事件。第三,为纳入更丰富的运动动态,训练另一个 DNN 推断被擦除块的光流。最后,提出使用不同类型 IE 与模态的两种集成策略以提升 VAD 性能,从而充分利用 temporal context 与模态信息用于 VAD。VEC 在常用 VAD 基准上能以显著优势(通常为 1.5%–5% AUROC)持续超越 SOTA 方法。我们的代码与结果可在 github.com/yuguangnudt/VEC_VAD 验证。

关键词

引用

@article{arxiv.2008.11988,
  title  = {Cloze Test Helps: Effective Video Anomaly Detection via Learning to Complete Video Events},
  author = {Guang Yu and Siqi Wang and Zhiping Cai and En Zhu and Chuanfu Xu and Jianping Yin and Marius Kloft},
  journal= {arXiv preprint arXiv:2008.11988},
  year   = {2020}
}

备注

To be published as an oral paper in Proceedings of the 28th ACM International Conference on Multimedia (ACM MM '20). 9 pages, 7 figures