面向人群异常事件检测的视听表示学习
计算机视觉与模式识别
2021-10-29 v1
摘要
近年来,人群场景中的异常事件检测因其对公共安全的重要性而吸引了许多研究者的关注。现有方法通常利用视觉信息来分析是否发生了异常事件,因为公共场所一般仅配备视觉传感器。然而,当人群中发生异常事件时,声音信息可能具有判别性,可辅助人群分析系统判断是否存在异常。与易被遮挡的视觉信息相比,音频信号具有一定程度的穿透性。因此,本文尝试利用多模态学习同时建模音频与视觉信号。具体而言,我们设计了一个双分支网络来建模不同类型的信息。其一是典型的 3D CNN 模型,用于从视频片段中提取时序外观特征。其二是用于编码音频信号 Log Mel-Spectrogram 的音频 CNN。最后,通过融合上述特征,将产生更准确的预测。我们在 SHADE 数据集(一个监控场景下的合成视听数据集)上进行了实验,发现引入音频信号有效提升了异常事件检测性能并优于其他 SOTA 方法。此外,我们将尽快发布代码与预训练模型。
引用
@article{arxiv.2110.14862,
title = {Audio-visual Representation Learning for Anomaly Events Detection in Crowds},
author = {Junyu Gao and Maoguo Gong and Xuelong Li},
journal= {arXiv preprint arXiv:2110.14862},
year = {2021}
}
备注
10 pages, 6 figures