LATERN:基于测试时间上下文感知的可解释视频异常检测
计算机视觉与模式识别
2026-05-15 v1
摘要
视觉语言模型(VLMs)最近作为视频异常检测(VAD)的热门范式,因其强大的视觉推理能力和自然语言基础可解释性而受到关注。本文旨在解决此类管道的一个关键局限性:由于token限制,该管道独立地对每个片段进行推理,缺乏结构化的时序上下文,导致VLMs将异常解释为演化的视频动态,而非生成碎片化的预测和解释。在指定方面,我们提出一种名为LATERN的上下文感知框架,将VAD重新表述为时序证据聚合过程。LATERN包含两个互补模块:上下文感知异常评分(CEA)和递归证据聚合(REA)。CEA引入一种新颖的图像 grounding 记忆机制,通过帧多样性和视觉-文本对齐等方式选择历史内容,将其作为扩展上下文用于生成可靠的异常评分。基于这些评分,REA执行递归时序聚合,以识别连贯的异常区间并产生以视觉-文本证据为依据的事件级决策和解释。在UCF-Crime和XD-Violence等具有挑战性的基准上进行的大量实验表明,LATERN在冻结VLMs测试时提升了检测准确性和解释一致性,同时生成连贯且在语义上依据视觉-文本证据的事件级解释。
引用
@article{arxiv.2605.15054,
title = {LATERN: Test-Time Context-Aware Explainable Video Anomaly Detection},
author = {Mitchell Piehl and Muchao Ye},
journal= {arXiv preprint arXiv:2605.15054},
year = {2026}
}