推进自适应多阶段视频异常推理:一个基准数据集与方法
计算机视觉与模式识别
2026-01-16 v1
摘要
多模态大语言模型在推理能力方面的最新进展凸显了其在执行复杂视频理解任务方面的潜力。然而,在视频异常检测与理解领域,现有基于MLLM的方法很大程度上局限于异常定位或事后描述,缺乏显式的推理过程、风险意识和面向决策的解释。为了填补这一空白,我们定义了一个名为视频异常推理的新任务,它将视频异常分析从描述性理解提升为结构化的多阶段推理。VAR明确要求模型在回答异常相关问题之前对异常事件进行渐进式推理,包括视觉感知、因果解释和风险感知决策制定。为了支持这一任务,我们提出了一个包含8,641个视频的新数据集,其中每个视频都标注了对应不同推理深度的多样化问题类型,总计超过50,000个样本,使其成为最大的视频异常数据集之一。这些标注基于结构化的感知-认知-行动思维链,该思维链形式化了视频异常理解的领域特定推理先验。这种设计使得对多阶段和自适应异常推理的系统评估成为可能。此外,我们提出了异常感知组相对策略优化,以在弱监督下进一步增强推理可靠性。基于所提出的任务和数据集,我们开发了一个端到端的基于MLLM的VAR模型,称为Vad-R1-Plus,它支持自适应分层推理和风险感知决策制定。大量实验表明,所提出的基准和方法有效地提升了MLLMs在VAR任务上的推理能力,优于开源和闭源基线。
引用
@article{arxiv.2601.10165,
title = {Advancing Adaptive Multi-Stage Video Anomaly Reasoning: A Benchmark Dataset and Method},
author = {Chao Huang and Benfeng Wang and Wei Wang and Jie Wen and Li Shen and Wenqi Ren and Yong Xu and Xiaochun Cao},
journal= {arXiv preprint arXiv:2601.10165},
year = {2026}
}