中文

GMFVAD:用于改进视频异常检测的颗粒化多模态特征

计算机视觉与模式识别 2025-12-16 v2 多媒体

摘要

视频异常检测(VAD)是一个具有挑战性的任务,用于检测连续监控视频中的异常帧。目前大多数研究方法利用视觉特征的时空关联性来区分视频片段中是否存在异常。最近,一些研究尝试引入多模态信息(如文本特征),以增强视频异常检测的结果。然而,这些方法仅以粗糙的方式将文本特征融合到视频片段中,忽略了视频片段中可能存在的大量冗余信息。因此,我们提出利用多模态信息之间的多样性进一步细化提取的特征,从而减少视觉特征中的冗余信息,并提出基于颗粒化多模态特征的视频异常检测方法(GMFVAD)。具体而言,我们基于视频片段生成更细粒度的多模态特征,该片段对视频的主要内容进行概括,并引入基于原始视频字幕的文本特征,以进一步增强突出部分的视觉特征。实验表明,所提出的GMFVAD在四个主要数据集上实现了最先进的性能。还通过消融实验验证,GMFVAD的改进归因于减少冗余信息。

关键词

引用

@article{arxiv.2510.20268,
  title  = {GMFVAD: Using Grained Multi-modal Feature to Improve Video Anomaly Detection},
  author = {Guangyu Dai and Dong Chen and Siliang Tang and Yueting Zhuang},
  journal= {arXiv preprint arXiv:2510.20268},
  year   = {2025}
}

备注

Accepted for publication in the Proceedings of the ICONIP 2025