中文

VAU-R1:通过强化微调推进视频异常理解

计算机视觉与模式识别 2025-05-30 v1

摘要

视频异常理解 (VAU) 对于智慧城市、安防监控和灾害预警系统等应用至关重要,但由于其需要细粒度的时空感知以及在模糊性下的鲁棒推理,仍然具有挑战性。尽管异常检测取得了进展,但现有方法通常缺乏可解释性,且难以捕捉异常事件的因果和上下文层面。缺乏用于评估异常场景中推理能力的综合基准进一步加剧了这一局限性。为了解决这两个挑战,我们引入了 VAU-R1,这是一个建立在多模态大语言模型 (MLLM) 之上的数据高效框架,通过强化微调 (RFT) 增强异常推理。此外,我们提出了 VAU-Bench,这是首个为视频异常推理量身定制的思维链基准,包含多项选择问答、详细理由、时间标注和描述性字幕。实证结果表明,VAU-R1 在不同上下文中显著提高了问答准确率、时间定位和推理连贯性。我们的方法和基准共同为可解释且具有推理感知的视频异常理解奠定了坚实基础。代码可在 https://github.com/GVCLab/VAU-R1 获取。

关键词

引用

@article{arxiv.2505.23504,
  title  = {VAU-R1: Advancing Video Anomaly Understanding via Reinforcement Fine-Tuning},
  author = {Liyun Zhu and Qixiang Chen and Xi Shen and Xiaodong Cun},
  journal= {arXiv preprint arXiv:2505.23504},
  year   = {2025}
}