中文

VADER: 面向因果视频异常理解的关系感知大语言模型

计算机视觉与模式识别 2025-12-15 v2

摘要

视频异常理解 (VAU) 旨在提供对视频中异常事件的详细解释和语义理解, addresses 传统方法仅关注检测和定位异常事件的局限性。然而,现有方法常忽视对象之间深层的因果关系和相互作用,这些关系对于理解异常行为至关重要。本文提出了 VADER,一个驱动大语言模型 (LLM) 的视频异常理解框架,通过整合关键帧对象的关系特征和视觉线索来增强对视频中异常事件的理解。具体而言,VADER 首先应用异常评分器为每个帧分配异常得分,随后采用情境感知抽样 (CAES) 策略捕获每个异常事件的因果情境。随后,关系特征提取器与对比关系编码器 (CORE) 联合建模动态对象之间的相互作用,生成用于下游推理的紧凑关系表示。这些视觉和关系线索与 LLM 集成,用于生成详细的、以因果为依据的描述,并支持稳健的异常相关问答。在多个真实世界的 VAU 基准测试上进行的实验表明,VADER 在异常描述、解释和因果推理任务中取得了强劲的性能,推动了可解释视频异常分析的前沿。

关键词

引用

@article{arxiv.2511.07299,
  title  = {VADER: Towards Causal Video Anomaly Understanding with Relation-Aware Large Language Models},
  author = {Ying Cheng and Yu-Ho Lin and Min-Hung Chen and Fu-En Yang and Shang-Hong Lai},
  journal= {arXiv preprint arXiv:2511.07299},
  year   = {2025}
}

备注

Accepted to WACV 2026. Project page available at: https://vader-vau.github.io/