中文

视频异常检测是否被误框定调?来自基于 LLM 的多场景模型的证据

计算机视觉与模式识别 2026-05-14 v1

摘要

最近的视频异常检测研究快速扩展,强调旨在跨越不同场景的通用正常模型。虽然这一关注导致了可扩展性和多场景泛化能力的提升,但也使该领域偏离了对单一场景中正常行为的特定化和情境依赖性建模。当代方法经常依赖视频级别的弱监督和来自多模态大语言模型 (MLLM) 的不透明预训练表示,这些方法鼓励模型响应熟悉的语义异常类别,而非响应偏离特定环境正常模式的偏差。这种趋势抑制了空间局部化,引入了语义偏差,并将异常检测简化为一种动作识别形式。本文我们检查这些主流形式是否与实际应用中视频异常检测的核心要求一致,即通常在单个场景中执行,其中正常性由局部几何、语义和活动模式决定。通过针对性的视觉分析和实证评估,我们展示了这些限制的实际后果,表明视频异常检测需要重新关注单一场景、空间感知和可解释的表述,以捕捉单个环境中正常性细微结构。

关键词

引用

@article{arxiv.2605.12725,
  title  = {Is Video Anomaly Detection Misframed? Evidence from LLM-Based and Multi-Scene Models},
  author = {Furkan Mumcu and Michael J. Jones and Anoop Cherian and Yasin Yilmaz},
  journal= {arXiv preprint arXiv:2605.12725},
  year   = {2026}
}