中文

推理引导式 grounding:通过多模态大语言模型提升视频异常检测

计算机视觉与模式识别 2026-05-06 v1 人工智能 机器学习

摘要

视频异常检测(VAD)传统上被建模为二元分类或离群点检测,既无法提供可解释的推理,也无法精确定位异常事件。虽然视觉语言模型(VLM)提供丰富的场景理解,但在可靠的空间 grounding方面困难——常常在要求对象定位时生成幻觉或几何无效的边界框。我们提出VANGUARD(Video Anomaly Understanding through Reasoning and Grounding),一个统一异常分类、空间 grounding和链式思考推理的VLM框架。VANGUARD引入三阶段课程式训练:(1)在冻结特征提取器上进行分类器预热;(2)LoRA适配的空间 grounding;(3)链式思考生成。为克服VAD基准数据稀缺注释问题,我们采用教师-学生注释管道,其中VLM(Qwen3-VL-4B)基于UCA数据集可用的手动注释生成结构化的子片段推理轨迹。进一步,GroundingDINO提供边界框监督。在UCF-Crime上,VANGUARD实现94% ROC-AUC和84% F1分数,同时生成可解释的链式思考解释和异常对象的空间 grounding——这些能力在先前VAD方法中均不存在。消融实验确认,阶段性训练优于单一优化,结构化推理作为隐式正则器导致更平衡的预测,而仅进行分类微调。零样本迁移到XD-Violence和ShanghaiTech显示出跨域泛化,无需目标域适应。

关键词

引用

@article{arxiv.2605.02912,
  title  = {Reasoning-Guided Grounding: Elevating Video Anomaly Detection through Multimodal Large Language Models},
  author = {Sakshi Agarwal and Aishik Konwer and Ankit Parag Shah},
  journal= {arXiv preprint arXiv:2605.02912},
  year   = {2026}
}

备注

under review at conference