中文

动作提示:语义典型性与上下文唯一性用于通用的基于骨架的视频异常检测

计算机视觉与模式识别 2026-04-30 v2

摘要

零样本视频异常检测(ZS-VAD)需要在无目标域训练数据的情况下对异常进行时序定位,这是由于数据隐私或新部署监控等实际考量而至关重要的任务。基于骨架的方法在消除背景和人类外观差异方面具有内在的泛化优势,能够实现ZS-VAD。然而,现有方法仅学习低层次骨架表征,依赖于受限于域的正常边界,无法良好泛化到具有不同正常与异常行为模式的新场景。本文提出一种新型的零样本视频异常检测框架,通过学习动作典型性和唯一性来发掘骨架数据的潜能。首先,我们引入一种语言引导的语义典型性建模模块,将骨架片段投影到动作语义空间中,并在训练期间从大语言模型(LLM)中蒸馏典型正常和异常行为的知识。其次,我们提出一种测试时上下文唯一性分析模块,用于细致分析骨架片段与背景之间的时空差异,从而推导出场景自适应边界。无需使用来自目标域的任何训练样本,我们的方法在四个大型视频异常检测数据集(ShanghaiTech、UBnormal、NWPU、UCF-Crime)上实现了最先进的成绩,其中包括超过100个未见过的监控场景。

关键词

引用

@article{arxiv.2509.11058,
  title  = {Action Hints: Semantic Typicality and Context Uniqueness for Generalizable Skeleton-based Video Anomaly Detection},
  author = {Canhui Tang and Sanping Zhou and Haoyue Shi and Le Wang},
  journal= {arXiv preprint arXiv:2509.11058},
  year   = {2026}
}

备注

The paper has been accepted by Pattern Recognition (PR)