Sherlock:面向多场景视频异常事件抽取与定位的全局-局部空间感知大语言模型
计算机视觉与模式识别
2025-02-27 v1 人工智能
摘要
针对视频异常检测(VAD)的现有研究主要聚焦于判断视频中每个帧是否异常,忽略了结构化的视频语义信息(即异常事件发生的“何时何地”)。为此,我们提出一种新的聊天式任务——多场景视频异常事件抽取与定位(M-VAE),旨在抽取异常事件四元组(即主体、事件类型、客体、场景)并定位该事件。进一步指出,该任务面临两个关键挑战:全局-局部空间建模与全局-局部空间平衡。为此,我们提出一种基于大语言模型(LLM)的全局-局部空间感知模型,名为Sherlock(即如Sherlock Holmes般追查犯罪事件),以解决上述挑战。具体而言,该模型设计了全局-局部空间增强的混合专家(GSM)模块和空间不平衡调节器(SIR),分别针对两个挑战进行解决。在我们的M-VAE指令数据集上进行的大量实验表明,Sherlock相较于几种先进的视频-LLM具有显著优势。这证明了全局-局部空间信息对M-VAE任务的重要性以及Sherlock在捕获此类信息方面的有效性。
引用
@article{arxiv.2502.18863,
title = {Sherlock: Towards Multi-scene Video Abnormal Event Extraction and Localization via a Global-local Spatial-sensitive LLM},
author = {Junxiao Ma and Jingjing Wang and Jiamin Luo and Peiying Yu and Guodong Zhou},
journal= {arXiv preprint arXiv:2502.18863},
year = {2025}
}