RefineVAD:基于语义引导的弱监督视频异常检测特征重校准
计算机视觉与模式识别
2025-12-30 v2
摘要
弱监督视频异常检测旨在仅使用视频级别标签识别异常事件,在标注效率与实际适用性之间取得平衡。然而,现有方法常通过将所有异常事件视为单一类别来简化异常空间,忽视了真实世界异常所固有的语义和时间特征。以人类感知异常的方式为灵感,we propose RefineVAD,这是一个模拟这种双过程推理的框架。我们的框架集成了两个核心模块。第一个模块是感知-aware 时间注意力和重校准(MoTAR),估计运动显著性,通过平移注意力和全局 Transformer 建模动态调整时间注意力。第二个模块是类别导向的细化(CORE),通过跨注意力将分段级特征与可学习的类别原型对齐,注入软异常类别先验到表示空间。通过联合利用时间动力学和语义结构,显式建模“how”运动如何演变以及“what”语义类别。广泛的在 WVAD 基准上的实验验证了 RefineVAD 的有效性,并突显了整合语义上下文以引导特征向异常相关模式重校准的重要性。
引用
@article{arxiv.2511.13204,
title = {RefineVAD: Semantic-Guided Feature Recalibration for Weakly Supervised Video Anomaly Detection},
author = {Junhee Lee and ChaeBeen Bang and MyoungChul Kim and MyeongAh Cho},
journal= {arXiv preprint arXiv:2511.13204},
year = {2025}
}
备注
Accepted to AAAI 2026