从视频异常检测到视频异常检索:新基准与模型
计算机视觉与模式识别
2024-02-29 v2 人工智能
摘要
视频异常检测(VAD)因其潜在应用而受到越来越多的关注,其当前主导任务聚焦于在线检测异常(帧级),可粗略解释为二分类或多事件分类。然而,这种在复杂异常事件与单一标签(如“ vandalism”)间建立关系的设定是肤浅的,因为单一标签不足以刻画异常事件。现实中,用户倾向于搜索特定视频而非一系列近似视频。因此,使用详细描述检索异常事件实用且积极,但极少研究关注此点。在此背景下,我们提出称为视频异常检索(VAR)的新任务,旨在通过对跨模态(如语言描述与同步音频)务实检索相关异常视频。与当前假定视频时间上良好裁剪且时长较短的视频检索不同,VAR 设计用于检索可能与给定查询部分相关的长未裁剪视频。为此,我们提出两个大规模 VAR 基准 UCFCrime-AR 与 XDViolence-AR,构建于主流异常数据集之上。同时,我们为 VAR 设计称为异常引导对齐网络(ALAN)的模型。在 ALAN 中,我们提出异常引导采样以聚焦长未裁剪视频中的关键片段。随后,我们引入高效 pretext task 以增强视频-文本细粒度表示间的语义关联。此外,我们利用两种互补对齐进一步匹配跨模态内容。在两个基准上的实验结果揭示了 VAR 任务的挑战,也展示了我们定制方法的优势。字幕公开于 https://github.com/Roc-Ng/VAR。
引用
@article{arxiv.2307.12545,
title = {Towards Video Anomaly Retrieval from Video Anomaly Detection: New Benchmarks and Model},
author = {Peng Wu and Jing Liu and Xiangteng He and Yuxin Peng and Peng Wang and Yanning Zhang},
journal= {arXiv preprint arXiv:2307.12545},
year = {2024}
}
备注
This work has been accepted to the IEEE TIP. Copyright has been transferred