多模态 LLM 是否准备好用于监控?对零样本野外异常检测的现实检验
计算机视觉与模式识别
2026-05-19 v2 人工智能
摘要
多模态大语言模型(MLLMs)在视频理解方面展现了惊人的通用能力,但其在真实世界视频异常检测(VAD)中的可靠性尚未得到广泛探索。不同于依赖重建或姿态线索的常规管道,MLLMs 实现了范式转变:将异常检测建模为语言引导的推理任务。本文系统评估了最先进的 MLLMs 在 ShanghaiTech 和 CHAD 数据集上的表现,通过将 VAD 重构为在弱时间监督下的二元分类任务来实现。我们研究了提示具体性和时间窗口长度(1s--3s)如何影响性能,关注精确率-召回率之间的权衡。我们的发现表明,在零样本设置中,模型表现出明显的保守偏差;尽管模型表现出高置信度,但它们倾向于偏好“正常”类别,导致高精确率但召回率崩溃,限制了实际用途。我们演示了类别特定指令可显著改变这一决策边界,将在 ShanghaiTech 上的峰值 F1 分数从 0.09 提升到 0.64,但召回率仍然是关键瓶颈。这些结果凸显了 MLLMs 在噪声环境下性能差距,为未来在召回率导向的提示和模型校准方面提供了基础,开放世界监控需要复杂的视频理解和推理。
引用
@article{arxiv.2603.04727,
title = {Are Multimodal LLMs Ready for Surveillance? A Reality Check on Zero-Shot Anomaly Detection in the Wild},
author = {Shanle Yao and Armin Danesh Pazho and Narges Rashvand and Hamed Tabkhi},
journal= {arXiv preprint arXiv:2603.04727},
year = {2026}
}