HyCoVAD:一种用于复杂视频异常检测的SSL-LLM混合模型
计算机视觉与模式识别
2025-12-02 v3
摘要
视频异常检测(VAD)对智能监控至关重要,但一个重大挑战在于识别复杂异常,这类事件是由多个实体之间错综复杂的关系和时间依赖性所定义的,而非孤立的动作。虽然自监督学习(SSL)方法能有效建模低层时空模式,但它们通常难以把握这些交互的语义含义。相反,大语言模型提供了强大的上下文推理能力,但在逐帧分析中计算成本高昂,且缺乏细粒度的空间定位。我们提出了HyCoVAD(混合复杂视频异常检测),一种结合多任务SSL时间分析器与LLM验证器的SSL-LLM混合模型。SSL模块建立在nnFormer主干网络之上,这是一种用于图像分割的基于Transformer的模型。它通过多个代理任务进行训练,从视频帧中学习以识别疑似异常的帧。随后,选定的帧被转发至LLM,LLM通过应用结构化的、基于规则的推理来验证异常的存在,从而以语义上下文丰富分析。在具有挑战性的ComplexVAD数据集上的实验表明,HyCoVAD实现了72.5%的帧级AUC,在减少LLM计算量的同时,性能比现有基线提高了12.5%。我们发布了交互异常分类体系、自适应阈值协议和代码,以促进未来在复杂VAD场景中的研究。
引用
@article{arxiv.2509.22544,
title = {HyCoVAD: A Hybrid SSL-LLM Model for Complex Video Anomaly Detection},
author = {Mohammad Mahdi Hemmatyar and Mahdi Jafari and Mohammad Amin Yousefi and Mohammad Reza Nemati and Mobin Azadani and Hamid Reza Rastad and Amirmohammad Akbari},
journal= {arXiv preprint arXiv:2509.22544},
year = {2025}
}
备注
25 pages, 1 figure