中文

基于解缠语义对齐的弱监督视频异常检测网络DSANet

计算机视觉与模式识别 2025-11-14 v1

摘要

近期在弱监督视频异常检测方面的研究取得了显著进展,通过应用基于多模态基础模型如CLIP的多实例学习范式来突出异常实例并分类类别。然而,这些方法的目标可能倾向于检测最显著的响应片段,同时忽略从异常模式中提取的多样化正常模式,并且容易因相似外观导致类别混淆,导致细粒度分类结果不令人满意。因此,我们提出一种新的解缠语义对齐网络(DSANet),通过从粗粒度和细粒度方面显式地分离异常和正常特征,增强可区分性。具体而言,在粗粒度层面,我们引入一个自引导的正常性建模分支,该分支在所学习的正常原型的指导下重构输入视频特征,鼓励模型利用视频中内在的正常线索,从而提高正常模式与异常事件的时间分离。在细粒度层面,我们提出一种解耦的对比语义对齐机制,该机制首先使用帧级异常得分将每个视频分解为事件导向和背景导向组件,然后应用视觉-语言对比学习以增强类别判别性表征。针对XD-Violence和UCF-Crime两个标准基准进行的全面实验表明,DSANet在现有SOTA方法方面表现优异。

关键词

引用

@article{arxiv.2511.10334,
  title  = {Learning to Tell Apart: Weakly Supervised Video Anomaly Detection via Disentangled Semantic Alignment},
  author = {Wenti Yin and Huaxin Zhang and Xiang Wang and Yuqing Lu and Yicheng Zhang and Bingquan Gong and Jialong Zuo and Li Yu and Changxin Gao and Nong Sang},
  journal= {arXiv preprint arXiv:2511.10334},
  year   = {2025}
}

备注

Accepted to AAAI 2026. Code is available at https://github.com/lessiYin/DSANet