中文

SphereVAD:基于单位超球面测地线推断的无训练视频异常检测

计算机视觉与模式识别 2026-05-11 v1

摘要

视频异常检测(VAD)旨在自动识别危机视频中偏离正常模式的事件。现有方法普遍依赖大规模标注或任务特定的训练程序,严重限制了将其快速部署到新场景的能力。我们观察到,预训练多模态大语言模型(MLLM)的中间层特征已经编码了丰富的异常语义,但现有方法依赖语言输出路径,未能利用这些表示所潜在的几何判别性。基于此发现,我们提出了 SphereVAD,这是一个完全无训练的、零样本 VAD 框架,将异常判别重新表述为在单位超球面上进行 von Mises-Fisher(vMF)似然比测地线推断,凭借原则性的几何推理而非学习新表征来释放判别性。具体而言,SphereVAD 首先应用弗莱曲均值centering 来展开特征分布并消除领域偏置,然后采用整体场景注意力(Holistic Scene Attention, HSA)利用跨视频先验信息强化特征一致性,最后执行 vMF 引导的球面测地线拉拽(Spherical Geodesic Pulling, SGP)将模糊片段与球面上方向性原型对齐。该无训练管道仅需最小量的合成图像进行校准。SphereVAD 在三个主要基准数据集上建立了训练-free 方法的新纪录,成绩优于完全监督的基线。代码将在接受后公开。

关键词

引用

@article{arxiv.2605.08003,
  title  = {SphereVAD: Training-Free Video Anomaly Detection via Geodesic Inference on the Unit Hypersphere},
  author = {Chao Huang and Penfei Wei and Wei Wang and Jie Wen and Zhihua Wang and Li Shen and Wenqi Ren and Xiaochun Cao},
  journal= {arXiv preprint arXiv:2605.08003},
  year   = {2026}
}

备注

48 pages, 25 figures