中文

基于 Vision Transformer 多上下文预测的视频异常检测

计算机视觉与模式识别 2022-06-20 v1

摘要

视频异常检测(VAD)传统上由两种主要方法处理:基于重构的方法与基于预测的方法。由于基于重构的方法学习对输入图像进行泛化,模型仅学习恒等函数,并严重引发所谓的泛化问题。另一方面,由于基于预测的方法学习给定若干先前帧来预测未来帧,它们对泛化问题较不敏感。然而,模型能否学习视频的时空上下文仍不确定。我们的直觉是,理解视频的时空上下文在 VAD 中起着至关重要的作用,因为它提供了关于视频片段中事件外观如何变化的精确信息。因此,为充分利用上下文信息以用于视频场景下的异常检测,我们设计了具有三种不同上下文预测流的 Transformer 模型:掩码、整体与局部。通过学习预测连续正常帧中的缺失帧,我们的模型能有效学习视频中的多种正常模式,从而在不符合所学上下文的异常情况下产生高重构误差。为验证方法有效性,我们在公开基准数据集 USCD Pedestrian 2、CUHK Avenue 与 ShanghaiTech 上评估模型,并采用重构误差异常分数指标评价性能。结果表明,相较现有视频异常检测方法,我们所提方法取得了具有竞争力的性能。

关键词

引用

@article{arxiv.2206.08568,
  title  = {Multi-Contextual Predictions with Vision Transformer for Video Anomaly Detection},
  author = {Joo-Yeon Lee and Woo-Jeoung Nam and Seong-Whan Lee},
  journal= {arXiv preprint arXiv:2206.08568},
  year   = {2022}
}