监控视频中视觉-LLM的评估
计算机视觉与模式识别
2025-10-28 v1
摘要
摄像机在我们社会中的广泛使用导致视频数据量巨大,远超人类监控的能力。这对公共安全和安全提出了巨大挑战,因为及时检测异常或犯罪事件对于有效响应和预防至关重要。具身智能体识别意外事件的能力,根本取决于其空间推理能力。本文通过将异常动作识别建模为零样本、语言导向的任务,来探讨视觉-语言模型(VLM)的空间推理。具体而言,我们调查小型预训练视觉-LLM是否能作为空间导向的零样本异常检测器,通过将视频转换为文本描述并通过文本蕴涵对标签进行评分来实现。我们在UCF-Crime和RWF-2000上评估了四个开源模型,在提示和隐私保护条件下进行测试。少量样本可以提高某些模型的准确率,但可能会增加误报率,隐私过滤器——特别是全身GAN变换——会引入不一致性,降低准确率。这些结果描绘了当前视觉-LLM成功(简单、空间显著事件)和失败(噪声空间线索、身份隐去)的场景。展望未来,我们概述了在无需任务特定训练的情况下加强空间 grounding 的具体路径:结构感知提示、跨剪辑的轻量级空间记忆、场景图或3D-姿态先验用于描述,以及保持行动相关几何的隐私方法。将零样本、语言导向的管道作为具身现实视频理解的可适应构建模块。我们的实现可在 https://github.com/pascalbenschopTU/VLLM_AnomalyRecognition 获取。
引用
@article{arxiv.2510.23190,
title = {Evaluation of Vision-LLMs in Surveillance Video},
author = {Pascal Benschop and Cristian Meo and Justin Dauwels and Jelte P. Mense},
journal= {arXiv preprint arXiv:2510.23190},
year = {2025}
}
备注
Accepted as poster in the NeurIPS 2025 Workshop on Space in Vision, Language, and Embodied AI