中文

Vad-R1:基于感知到认知思维链的视频异常推理

计算机视觉与模式识别 2025-05-27 v1

摘要

多模态大语言模型(MLLMs)推理能力的最新进展证明了其在处理复杂视觉任务方面的有效性。然而,现有的基于 MLLM 的视频异常检测(VAD)方法仍局限于浅层的异常描述,缺乏深度推理。在本文中,我们提出了一项名为视频异常推理(VAR)的新任务,旨在通过要求 MLLM 在回答前进行显式思考,实现对视频中异常的深度分析和理解。为此,我们提出了 Vad-R1,一个用于 VAR 的端到端基于 MLLM 的框架。具体而言,我们设计了感知到认知思维链(P2C-CoT),模拟人类识别异常的过程,引导 MLLM 逐步推理异常。基于结构化的 P2C-CoT,我们构建了 Vad-Reasoning,一个专门用于 VAR 的数据集。此外,我们提出了一种改进的强化学习算法 AVA-GRPO,该算法通过带有有限标注的自验证机制,显式地激励 MLLM 的异常推理能力。实验结果表明,Vad-R1 取得了优越的性能,在 VAD 和 VAR 任务上均优于开源和专有模型。代码和数据集将发布于 https://github.com/wbfwonderful/Vad-R1。

关键词

引用

@article{arxiv.2505.19877,
  title  = {Vad-R1: Towards Video Anomaly Reasoning via Perception-to-Cognition Chain-of-Thought},
  author = {Chao Huang and Benfeng Wang and Jie Wen and Chengliang Liu and Wei Wang and Li Shen and Xiaochun Cao},
  journal= {arXiv preprint arXiv:2505.19877},
  year   = {2025}
}

备注

9 pages, 4 figures