与 $\pi$ 一起 just dance!面向弱监督视频异常检测的多模态感应器
计算机视觉与模式识别
2025-05-20 v1 人工智能
机器学习
摘要
弱监督视频异常检测(VAD)的方法通常仅基于RGB时空特征,这在实际场景中限制了其可靠性。这是因为RGB特征在区分诸如零售偷窃等类似类别时并不够具辨识度。因此,要实现可靠的复杂实际场景VAD,必须通过额外的模态来增强RGB时空特征。为此,我们引入一种面向VAD的多模态感应框架:'PI-VAD',一种新颖的方法,通过五种额外模态来增强RGB表征。具体而言,这些模态包括对细粒度运动的敏感性(Pose)、三维场景和实体表示(Depth)、周围物体(Panoptic masks)、全局运动(光流)以及语言线索(VLM)。每个模态代表一个多边形的轴,简化为为RGB添加显著线索。PI-VAD包含两个可插拔模块,即伪模态生成模块和跨模态感应模块,这些模块通过执行异常感知辅助任务来生成模态特定的原型表征,从而将多模态信息诱导进入RGB线索。这两个模块需要五个模态主干网络——仅在训练期间使用。值得注意的是,PI-VAD在三个包含真实场景的主要VAD数据集上实现了最先进的准确率,而无需在推理时增加五个模态主干网络的计算开销。
引用
@article{arxiv.2505.13123,
title = {Just Dance with $\pi$! A Poly-modal Inductor for Weakly-supervised Video Anomaly Detection},
author = {Snehashis Majhi and Giacomo D'Amicantonio and Antitza Dantcheva and Quan Kong and Lorenzo Garattoni and Gianpiero Francesca and Egor Bondarev and Francois Bremond},
journal= {arXiv preprint arXiv:2505.13123},
year = {2025}
}