中文

Anomize:更优的开放词汇视频异常检测

计算机视觉与模式识别 2025-03-25 v1

摘要

开放词汇视频异常检测(Open Vocabulary Video Anomaly Detection, OVVAD)旨在检测和分类基本异常及新颖异常。然而,现有方法在面对新颖异常时存在两个特定挑战。第一个挑战是检测模糊,模型难以为不熟悉的异常分配准确的异常得分。第二个挑战是分类混淆,新颖异常常被误分类为视觉上相似的基本实例。为解决这些挑战,我们探索了来自多个来源的补充信息,通过利用多层次视觉数据并结合匹配的文本信息来缓解检测模糊。此外,我们提出了引入标签关系以引导新标签编码,从而提高新视频与其对应标签之间的对齐程度,以减少分类混淆。最终得到的Anomize框架有效解决了这些问题,在UCF-Crime和XD-Violence数据集上实现了卓越的性能,展示了其在OVVAD中的有效性。

关键词

引用

@article{arxiv.2503.18094,
  title  = {Anomize: Better Open Vocabulary Video Anomaly Detection},
  author = {Fei Li and Wenxuan Liu and Jingjing Chen and Ruixu Zhang and Yuran Wang and Xian Zhong and Zheng Wang},
  journal= {arXiv preprint arXiv:2503.18094},
  year   = {2025}
}