引导与矫正冻结多模态大语言模型中潜在表示流形用于视频异常检测
计算机视觉与模式识别
2026-03-02 v1
摘要
视频异常检测(VAD)旨在识别视频中的异常事件。传统VAD方法通常面临标注数据和全量训练的高成本,因此近期一些研究探索利用冻结的多模态大语言模型(MLLM)以无调参方式完成VAD。然而其性能受限于直接继承预训练偏见,无法适应特定视频语境的内部表示,导致难以处理细微或模糊的异常。为此,我们提出一种新颖干预框架,称为SteerVAD,使基于MLLM的VAD从被动读取转向主动引导与矫正内部表示。我们的方法首先利用梯度-free的表示可分性分析(RSA)识别出顶级注意力头作为潜在异常专家(LAE),这些头最具判别VAD的能力。随后,层次化元控制器(HMC)通过同时条件化全局语境和这些LAE输出,生成动态矫正信号。这些信号直接作用于LAE表示流形上,执行有针对性的各向异性缩放,将异常相关维度放大,抑制固有偏见。广泛的实验在主流基准数据集上表明,我们的方法在仅使用1%训练数据的情况下,以无调参方式实现了超越现有SOTA的性能,确立了视频异常检测的强大新方向。代码将在论文发表后公开。
引用
@article{arxiv.2602.24021,
title = {Steering and Rectifying Latent Representation Manifolds in Frozen Multi-modal LLMs for Video Anomaly Detection},
author = {Zhaolin Cai and Fan Li and Huiyu Duan and Lijun He and Guangtao Zhai},
journal= {arXiv preprint arXiv:2602.24021},
year = {2026}
}
备注
Accepted by ICLR 2026