通过学习完成视觉完形填空测试实现视频异常事件检测
计算机视觉与模式识别
2021-09-20 v2 人工智能
摘要
尽管深度神经网络(DNNs)使视频异常事件检测(VAD)取得了巨大进展,现有方案通常存在两个问题:(1)视频事件的定位无法同时做到精确与全面。(2)语义与时间上下文未被充分挖掘。为解决这些问题,我们受教育中盛行的完形填空测试启发,提出一种名为视觉完形填空补全(VCC)的新方法,该方法通过学习完成“视觉完形填空测试”(VCTs)来进行VAD。具体而言,VCC首先定位每个视频事件并将其包围进一个时空立方体(STC)。为实现精确且全面的定位,外观与运动被用作互补线索来标记与每个事件相关联的目标区域。对于每个标记区域,从当前及相邻帧提取归一化块序列并堆叠为STC。将STC的每个块与块序列分别类比于视觉“单词”与“句子”,我们有意擦除某个“单词”(块)以生成VCT。然后,通过训练DNNs利用视频语义推断被擦除块及其光流来完成VCT。同时,VCC通过交替擦除时间上下文中的每个块并创建多个VCT,充分挖掘时间上下文。此外,我们提出定位级、事件级、模型级与决策级解决方案来增强VCC,可进一步挖掘VCC潜力并产生显著的性能提升。大量实验表明VCC达到了最先进的VAD性能。我们的代码与结果已开源于https://github.com/yuguangnudt/VEC_VAD/tree/VCC。
引用
@article{arxiv.2108.02356,
title = {Video Abnormal Event Detection by Learning to Complete Visual Cloze Tests},
author = {Siqi Wang and Guang Yu and Zhiping Cai and Xinwang Liu and En Zhu and Jianping Yin},
journal= {arXiv preprint arXiv:2108.02356},
year = {2021}
}