中文

Quo Vadis, Anomaly Detection? LLMs and VLMs in the Spotlight

计算机视觉与模式识别 2024-12-25 v1 人工智能 机器学习

摘要

视频异常检测 (VAD) 通过整合大语言模型 (LLMs) 和视觉语言模型 (VLMs) 实现了显著进展,这些模型解决了可解释性、时序推理和在动态开放世界场景中的泛化等关键挑战。本文综述了 2024 年领先的 LLM-/VLM-based 方法,重点关注四个关键方面:(i) 通过语义见解和文本解释提升可解释性,使视觉异常更易理解;(ii) 捕获复杂的时序关系,以检测和定位视频帧中的动态异常;(iii) 实现 few-shot 和 zero-shot 检测,最小化对大规模标注数据集的依赖;(iv) 使用语义理解和运动特征处理时空一致性,解决开放世界和 class-agnostic 异常问题。我们强调这些方法有潜力重新定义 VAD 的格局。此外,我们探讨了 LLMs 和 VLMs 提供的视觉与文本模态的协同优势,突出其组合优势,并提出未来方向以充分发挥其在提升视频异常检测方面的潜力。

关键词

引用

@article{arxiv.2412.18298,
  title  = {Quo Vadis, Anomaly Detection? LLMs and VLMs in the Spotlight},
  author = {Xi Ding and Lei Wang},
  journal= {arXiv preprint arXiv:2412.18298},
  year   = {2024}
}

备注

Research report