利用多模态大语言模型的活动描述实现可解释的半监督视频异常检测
计算机视觉与模式识别
2026-03-02 v2
摘要
现有的半监督视频异常检测 (VAD) 方法在检测涉及物体交互的复杂异常时往往表现欠佳,且普遍缺乏可解释性。为克服这些局限,我们提出一种新颖的 VAD 框架,利用多模态大语言模型 (MLLMs)。与以往在帧层级直接进行异常判定的 MLLM 方法不同,我们的方法聚焦于随时间提取并解释物体活动及其交互。通过在不同时间点向 MLLM 输入物体对的视觉信息,我们从正常视频中生成活动与交互的文本描述。这些文本描述充当视频中物体活动与交互的高层表示。在测试时,通过将其与正常训练视频中的文本描述进行比较来检测异常。我们的方法天然具备可解释性,并可与多种传统 VAD 方法结合以进一步增强其可解释性。在基准数据集上的大量实验表明,我们的方法不仅能有效检测基于交互的复杂异常,还在不含交互异常的数据集上取得了最先进的性能。
引用
@article{arxiv.2510.14896,
title = {Leveraging Multimodal LLM Descriptions of Activity for Explainable Semi-Supervised Video Anomaly Detection},
author = {Furkan Mumcu and Michael J. Jones and Anoop Cherian and Yasin Yilmaz},
journal= {arXiv preprint arXiv:2510.14896},
year = {2026}
}