中文

GridVAD:通过分层帧网格上的空间推理进行开集视频异常检测

计算机视觉与模式识别 2026-04-03 v2

摘要

视觉-语言模型(VLMs)是强大的开集推理器,但将其直接用作视频监控中的异常检测器是脆弱的:在没有校准的异常先验的情况下,它们在漏检和幻觉误报之间交替出现。我们认为问题不在于 VLM 本身,而在于其使用方式。VLMs 应该充当异常提议者,生成开集候选描述,然后由专门构建的空间和时间模块进行定位和跟踪。我们在 GridVAD 中实例化了这一提议-定位-传播原则,这是一个无需训练的流水线,无需任何领域特定训练即可生成像素级异常掩码。VLM 对视频片段的分层网格表示进行推理,以生成自然语言异常提议。自一致性整合(Self-Consistency Consolidation, SCC)通过仅保留在多次独立采样中重复出现的提议来过滤幻觉。定位 DINO 将每个保留的提议锚定到边界框,SAM2 将其作为密集掩码传播穿过异常区间。每个片段的 VLM 预算固定为 M+1 次调用,与视频长度无关,其中 M 可根据所需提议数量进行设置。在 UCSD Ped2 上,GridVAD 在所有对比方法中取得了最高的 Pixel-AUROC(77.59),甚至超越了部分微调的 TAO(75.11),并在物体级 RBDC 上以超过 5 倍的优势超越了其他零样本方法。消融实验表明,SCC 提供了可控的精确率-召回率权衡:过滤在物体级召回率适度下降的情况下改善了所有像素级指标。效率实验表明,GridVAD 比均匀逐帧 VLM 查询的调用效率高 2.7 倍,同时还能生成密集分割掩码。代码和定性视频结果可在 https://gridvad.github.io 获取。

关键词

引用

@article{arxiv.2603.25467,
  title  = {GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids},
  author = {Mohamed Eltahir and Ahmed O. Ibrahim and Obada Siralkhatim and Tabarak Abdallah and Sondos Mohamed},
  journal= {arXiv preprint arXiv:2603.25467},
  year   = {2026}
}