稀疏推理即可:基于大型预训练模型的视频异常检测生物学启发框架
计算机视觉与模式识别
2025-11-24 v1
摘要
视频异常检测(VAD)在安防监控、自动驾驶和工业监控等实际应用中发挥着关键作用。最近的大型预训练模型进展为通过利用丰富的先验知识和通用推理能力实现无训练 VAD 带来了新机会。然而,现有研究通常依赖稠密帧级推理,导致高计算成本和延迟。这引出一个根本问题:在 VAD 系统中使用强大预训练模型时,稠密推理是否真的必要?为此,我们提出了 ReCoVAD,一种受人类神经系统中双重反射和意识通路启发的框架,实现选择性帧处理以减少冗余计算。ReCoVAD 由两个核心通路构成:(i) 一个反射通路,使用轻量级 CLIP 模块将视觉特征与原型提示融合并产生决策向量,这些向量查询过去帧和异常分数的动态记忆以实现快速响应;(ii) 一个意识通路,采用中等规模的视觉语言模型生成文本事件描述和细化后的异常分数以处理新帧。它持续更新记忆和原型提示,而一个集成的大型语言模型则定期审查累积的描述,以识别未见的异常、纠正错误并细化原型。大量实验表明,ReCoVAD 在保持无训练性能卓越的同时,仅使用前述方法在 UCF-Crime 和 XD-Violence 数据集上处理的帧数分别降低至 28.55% 和 16.04%,证明稀疏推理对于有效的大模型 VAD 已足够。
引用
@article{arxiv.2511.17094,
title = {Sparse Reasoning is Enough: Biological-Inspired Framework for Video Anomaly Detection with Large Pre-trained Models},
author = {He Huang and Zixuan Hu and Dongxiao Li and Yao Xiao and Ling-Yu Duan},
journal= {arXiv preprint arXiv:2511.17094},
year = {2025}
}