中文

HiProbe-VAD:基于隐藏状态探针的无调谐多模态 LLM 视频异常检测

计算机视觉与模式识别 2025-10-28 v1 人工智能

摘要

视频异常检测 (VAD) 旨在识别和定位视频序列中偏离正常模式的异常。传统方法往往在计算需求上存在 substantial 挤压,并且依赖大量标记数据,从而限制了其实际适用性。为此,我们提出了 HiProbe-VAD,一种新型框架,利用预训练多模态大型语言模型 (MLLM) 进行 VAD,无需 fine-tuning。在本文中,我们发现 MLLM 的中间隐藏状态包含信息丰富的表示,对于异常的灵敏度和线性可分性高于输出层。为此,我们提出了动态层显著性探针 (DLSP) 机制,智能识别和提取推理过程中来自最佳中间层的最具信息性的隐藏状态。随后,一个轻量级异常评分器和时域 localisation 模块高效利用这些提取的隐藏状态进行异常检测并生成解释。在 UCF-Crime 和 XD-Violence 数据集上的实验表明,HiProbe-VAD 在现有 training-free 方法和大多数传统方法上均显著优于后者。此外,我们的框架在不同 MLLM 上展现出惊人的跨模型泛化能力,无需任何调谐,解锁了预训练 MLLM 用于视频异常检测的潜力,为更实际和可扩展的解决方案铺平了道路。

关键词

引用

@article{arxiv.2507.17394,
  title  = {HiProbe-VAD: Video Anomaly Detection via Hidden States Probing in Tuning-Free Multimodal LLMs},
  author = {Zhaolin Cai and Fan Li and Ziwei Zheng and Yanjun Qin},
  journal= {arXiv preprint arXiv:2507.17394},
  year   = {2025}
}

备注

Accepted by ACM MM 2025