CoReVAD:面向免训练视频异常检测的上下文推理框架
计算机视觉与模式识别
2026-05-25 v1 人工智能
摘要
现有的视频异常检测(VAD)方法通常依赖于特定任务的训练,导致强烈的领域依赖和高昂的训练成本。此外,大多数现有方法仅输出标量异常分数,对特定事件为何被视为异常提供的洞察有限。视觉语言模型(VLM)的最新进展使得异常检测和人类可解释的推理成为可能。然而,许多基于 VLM 的方法仍需要额外的训练步骤(例如指令微调或言语化学习)或外部的大型语言模型(LLM),从而产生额外的训练成本和推理开销。为了应对这些挑战,我们提出 CoReVAD,一个用于免训练视频异常检测的上下文推理框架,该框架在单个冻结的 VLM 上运行。CoReVAD 直接从 VLM 生成异常分数和时间描述。为了减轻生成输出中的噪声,我们引入了基于局部视觉-文本对齐的局部响应清洗(LRC)模块。此外,通过基于 softmax 的细化、高斯平滑和位置加权,融入了全局时间上下文和演进过程。在 UCF-Crime 和 XD-Violence 上的实验表明,CoReVAD 在免训练方法中取得了具竞争力的性能,同时提供了可靠且可解释的解释。我们的官方代码可在:https://github.com/Muk-00/CoReVAD 获取
引用
@article{arxiv.2605.23116,
title = {CoReVAD: A Contextual Reasoning Framework for Training-Free Video Anomaly Detection},
author = {Hyeongmuk Lim and Youngbum Hur},
journal= {arXiv preprint arXiv:2605.23116},
year = {2026}
}
备注
Accepted to ICPR 2026