基于对比和预测时空建模的监控场景零样本异常检测
计算机视觉与模式识别
2025-08-28 v2 机器学习
摘要
在监控视频中检测异常事件本质上具有挑战性,因为其不可预测且具有上下文依赖性。本工作提出了一种新颖的上下文感知零样本异常检测框架,用于在训练时不暴露于异常示例。该框架的混合架构结合了 TimeSformer、DPC 和 CLIP 来建模时空动力学和语义上下文。TimeSformer 作为视觉主干,用于提取丰富的时空特征,而 DPC 则预测未来的表示以识别时序偏差。此外,基于 CLIP 的语义流通过上下文特定的文本提示实现概念级别的异常检测。这些组件使用 InfoNCE 和 CPC 损失函数联合训练,将视觉输入与其时序和语义表示对齐。进一步地,一种上下文门控机制通过场景感知线索或全局视频特征来调制预测,从而增强决策。通过将预测建模与视觉语言理解集成,该系统能够在复杂环境中对以前未见过的行为进行概括。该框架弥合了时序推理与语义上下文在监控场景零样本异常检测中的差距。本研究的代码已公开于 https://github.com/NK-II/Context-Aware-Zero-Shot-Anomaly-Detection-in-Surveillance。
关键词
引用
@article{arxiv.2508.18463,
title = {Context-Aware Zero-Shot Anomaly Detection in Surveillance Using Contrastive and Predictive Spatiotemporal Modeling},
author = {Md. Rashid Shahriar Khan and Md. Abrar Hasan and Mohammod Tareq Aziz Justice},
journal= {arXiv preprint arXiv:2508.18463},
year = {2025}
}
备注
11 pages, 7 figures, 4 tables