中文

基于卷积Transformer的双判别器生成对抗网络用于视频异常检测

计算机视觉与模式识别 2021-07-30 v1 人工智能 机器学习 多媒体

摘要

在真实世界监控视频中检测异常活动是一项重要但具有挑战性的任务,因为关于视频异常的先验知识通常有限或不可用。尽管已开发了许多方法来解决此问题,但很少有方法能够高效且有效地捕捉正常的时空模式。此外,现有工作很少显式考虑帧级别的局部一致性与视频序列中时间动态的全局连贯性。为此,我们提出基于卷积Transformer的双判别器生成对抗网络(CT-D2GAN)来进行无监督视频异常检测。具体而言,我们首先提出一个卷积Transformer来执行未来帧预测。它包含三个关键组件,即捕捉输入视频片段空间信息的卷积编码器、编码时间动态的时间自注意力模块,以及整合时空特征并预测未来帧的卷积解码器。接下来,采用基于双判别器的对抗训练过程,联合考虑可维持帧级局部一致性的图像判别器与可强化时间动态全局连贯性的视频判别器,以增强未来帧预测。最后,利用预测误差来识别异常视频帧。在三个公开视频异常检测数据集(即UCSD Ped2、CUHK Avenue和Shanghai Tech Campus)上的充分实证研究表明了所提对抗时空建模框架的有效性。

关键词

引用

@article{arxiv.2107.13720,
  title  = {Convolutional Transformer based Dual Discriminator Generative Adversarial Networks for Video Anomaly Detection},
  author = {Xinyang Feng and Dongjin Song and Yuncong Chen and Zhengzhang Chen and Jingchao Ni and Haifeng Chen},
  journal= {arXiv preprint arXiv:2107.13720},
  year   = {2021}
}

备注

Accepted for publication in the 29th ACM International Conference on Multimedia (ACMMM '21)