迈向监控视频与语言理解:新数据集、基线及挑战
计算机视觉与模式识别
2023-12-05 v2 人工智能
摘要
监控视频是日常生活的重要组成部分,具有各种关键应用,尤其在公共安全领域。然而,当前监控视频任务主要聚焦于异常事件的分类与定位。尽管已有方法取得了可观性能,但它们仅限于检测与分类预定义事件,语义理解不尽如人意。为解决此问题,我们提出了监控视频与语言理解这一新研究方向,并构建了首个多模态监控视频数据集。我们对真实世界监控数据集 UCF-Crime 进行了细粒度事件内容与时序的手动标注。我们新标注的数据集 UCA(UCF-Crime Annotation)包含 23,542 个句子,平均长度 20 词,其标注视频时长长达 110.7 小时。此外,我们在此新创建的数据集上为四项多模态任务基准测试了 SOTA 模型,作为监控视频与语言理解的新基线。通过实验,我们发现此前公开数据集中使用的主流模型在监控视频上表现糟糕,这表明监控视频与语言理解存在新挑战。为验证 UCA 的有效性,我们在多模态异常检测上进行了实验。结果表明,我们的多模态监控学习能够提升传统异常检测任务的性能。所有实验均凸显了构建该数据集以推进监控 AI 的必要性。我们的数据集链接为:https://xuange923.github.io/Surveillance-Video-Understanding。
引用
@article{arxiv.2309.13925,
title = {Towards Surveillance Video-and-Language Understanding: New Dataset, Baselines, and Challenges},
author = {Tongtong Yuan and Xuange Zhang and Kun Liu and Bo Liu and Chen Chen and Jian Jin and Zhenzhen Jiao},
journal= {arXiv preprint arXiv:2309.13925},
year = {2023}
}