SRVAU-R1:通过反射感知学习提升视频异常理解
计算机视觉与模式识别
2026-02-03 v1
摘要
多模态大语言模型(MLLM)在推理能力方面取得显著进展,并在视频异常理解(VAU)任务中展现出前景。然而,现有基于MLLM的方法仍主要关注异常的表层描述,缺乏对异常行为(如显式自反思和自纠正)的深入推理。为此,我们提出了一种自反思增强推理框架用于视频异常理解(Self-Reflection-Enhanced Reasoning for Video Anomaly Understanding, SRVAU-R1),该框架在MLLM推理中融合反射机制。具体而言,SRVAU-R1 引入了首个针对 VAU 的反射导向链式思维数据集,提供包含初始推理、自反思和修订推理的结构化监督。基于此,它包含一种新颖的反射感知学习范式,结合监督微调和强化微调以增强 VAU 的多模态推理。在多个视频异常基准测试上的大量实验表明,SRVAU-R1 在视频异常时间局部化精度和推理质量方面均显著优于现有方法。
引用
@article{arxiv.2602.01004,
title = {SRVAU-R1: Enhancing Video Anomaly Understanding via Reflection-Aware Learning},
author = {Zihao Zhao and Shengting Cao and Muchao Ye},
journal= {arXiv preprint arXiv:2602.01004},
year = {2026}
}