中文

Holmes-VAU:面向任意粒度的长时段视频异常理解

计算机视觉与模式识别 2025-03-17 v2

摘要

我们如何才能使模型能够理解在不同时间尺度和情境下发生的视频异常?传统的视频异常理解(VAU)方法侧重于帧级异常预测,常常无法解释复杂且多样化的真实世界异常。最近的多模态方法利用视觉和文本数据,但缺乏能够捕捉短时和长时异常的层次化标注。为解决这一挑战,我们引入了HIVAU-70k,这是一个面向任意粒度的大规模层次化视频异常理解基准。我们开发了一个半自动标注引擎,通过结合手动视频分割和使用大语言模型(LLM)进行递归自由文本标注,高效地获得高质量的标注, resulting in 超过70,000个在片段级、事件级和视频级段落上组织的多粒度标注。为了高效处理长视频,我们提出了异常聚焦时间采样器(ATS)。ATS将异常评分器与密度感知采样器集成,以基于异常得分自适应选择帧,确保多模态LLM聚焦于异常丰富的区域,这显著提高了效率和准确性。大量实验表明,我们的层次化指令数据显著提升了异常理解能力。集成ATS和视觉语言模型在处理长视频方面超越了传统方法。我们的基准和模型已公开于https://github.com/pipixin321/HolmesVAU。

关键词

引用

@article{arxiv.2412.06171,
  title  = {Holmes-VAU: Towards Long-term Video Anomaly Understanding at Any Granularity},
  author = {Huaxin Zhang and Xiaohao Xu and Xiang Wang and Jialong Zuo and Xiaonan Huang and Changxin Gao and Shanjun Zhang and Li Yu and Nong Sang},
  journal= {arXiv preprint arXiv:2412.06171},
  year   = {2025}
}

备注

Accepted by CVPR2025