中文

用于视频异常检测的不确定性加权图像-事件多模态融合

计算机视觉与模式识别 2025-05-09 v2

摘要

大多数现有的视频异常检测器仅依赖RGB帧,这些帧缺乏捕捉突发或瞬态运动线索所需的时间分辨率,而这些线索是异常事件的关键指标。为了解决这一局限性,我们提出了用于视频异常检测的图像-事件融合框架(IEF-VAD),该框架直接从RGB视频合成事件表示,并通过一个原则性的、不确定性感知的过程将其与图像特征融合。该系统(i)使用学生t似然对重尾传感器噪声进行建模,通过拉普拉斯近似推导出值级逆方差权重;(ii)应用卡尔曼风格的逐帧更新来随时间平衡模态;(iii)迭代细化融合的潜在状态以消除残差跨模态噪声。在没有任何专用事件传感器或帧级标签的情况下,IEF-VAD在多个真实世界异常检测基准上设立了新的最先进水平。这些发现突显了合成事件表示在强调RGB帧中通常代表性不足的运动线索方面的实用性,从而无需专用事件传感器即可实现跨多种应用的准确且鲁棒的视频理解。代码和模型可在https://github.com/EavnJeong/IEF-VAD获取。

关键词

引用

@article{arxiv.2505.02393,
  title  = {Uncertainty-Weighted Image-Event Multimodal Fusion for Video Anomaly Detection},
  author = {Sungheon Jeong and Jihong Park and Mohsen Imani},
  journal= {arXiv preprint arXiv:2505.02393},
  year   = {2025}
}