中文

VADTree:基于层次粒度感知树的无训练可解释视频异常检测

计算机视觉与模式识别 2026-01-01 v3

摘要

视频异常检测(VAD)旨在识别视频中的异常。监督方法需要大量领域内训练数据,且难以为异常提供清晰的解释。相比之下,无训练方法利用大型预训练模型的知识储备和语言交互能力进行异常检测。然而,现有的固定长度时间窗口采样方法难以准确捕获具有不同时间跨度的异常。因此,我们提出 VADTree,利用层次粒度感知树(HGTree)结构实现灵活的采样。VADTree 利用预训练的通用事件边界检测(GEBD)模型中的知识来刻画潜在的异常事件边界。具体而言,VADTree 根据边界置信度将视频分解为通用事件节点,进行自适应的粗细层次结构构建和冗余删除以构建 HGTree。随后,将多维先验信息注入视觉语言模型(VLM)以增强节点级异常感知,通过大型语言模型(LLM)实现通用事件节点的异常推理。最后,使用集群间节点相关性方法整合多粒度异常得分。在三个具有挑战性的数据集上进行的广泛实验表明,VADTree 在无训练设置下实现了最先进的性能,同时大幅减少了采样视频片段的数量。该代码将在 https://github.com/wenlongli10/VADTree 上提供。

关键词

引用

@article{arxiv.2510.22693,
  title  = {VADTree: Explainable Training-Free Video Anomaly Detection via Hierarchical Granularity-Aware Tree},
  author = {Wenlong Li and Yifei Xu and Yuan Rao and Zhenhua Wang and Shuiguang Deng},
  journal= {arXiv preprint arXiv:2510.22693},
  year   = {2026}
}

备注

NeurIPS 2025 poster