中文

VAGU 与 GtS:基于 LLM 的视频异常定位与理解基准与框架

计算机视觉与模式识别 2025-07-30 v1 多媒体

摘要

视频异常检测旨在识别视频中的异常事件并准确确定其时间区间。当前 VAD 方法主要分为两类:关注时间局部化的传统深度神经网络方法,以及强调语义理解的 LLM 方法。异常的理解与定位对于全面的视频异常检测至关且可以相互补充。然而,现有模型或数据集均不支持同时处理这两个任务。为此,我们引入了 VAGU(Video Anomaly Grounding and Understanding),第一个集成这两个任务的基准测试。每个 VAGU 实例包括异常类别、语义解释、精确的时间定位和视频问答的注释。我们还提供多选视频问答以进行客观评估。基于该数据集,我们提出了 Glance then Scrutinize (GtS),一种由文本提示引导的无训练框架。该框架首先使对高概率异常区域进行粗略定位,然后进行详细的异常解释和时间边界细化。此外,我们提出了 JeAUG 指标,联合评估语义可解释性和时间精度,克服了传统指标的局限性。广泛的实验验证了我们基准测试、框架和评估指标的有效性。

关键词

引用

@article{arxiv.2507.21507,
  title  = {VAGU & GtS: LLM-Based Benchmark and Framework for Joint Video Anomaly Grounding and Understanding},
  author = {Shibo Gao and Peipei Yang and Yangyang Liu and Yi Chen and Han Zhu and Xuyao Zhang and Linlin Huang},
  journal= {arXiv preprint arXiv:2507.21507},
  year   = {2025}
}

备注

21 pages, 19 figures, 8 tables