VIDI:一个事故视频数据集
计算机视觉与模式识别
2023-01-10 v1
摘要
自然灾害与事故的自动检测作为快速响应的工具已变得愈发重要。已有许多研究利用静态图像和文本来检测事故。然而,利用时间信息的方法相当有限。其主要原因之一是缺乏包含多种事故类型的多样化视频数据集。为满足这一需求,本文我们提出一个视频数据集——事故视频数据集(VIDI),包含对应于43个事故类别的4534个视频片段。每个事故类别约有100个视频,平均时长为十秒。为增加多样性,我们以多种语言检索视频。为评估近期最先进方法Vision Transformer和TimeSformer的性能,并探究基于视频的信息对事故分类的贡献,我们在VIDI和Incidents Dataset上进行了基准实验。我们表明近期方法提升了事故分类准确率。我们发现采用视频数据对该任务极为有益。通过使用视频数据,top-1准确率从使用单帧获得的67.37%提升至76.56%。VIDI将公开可用。附加材料见链接:https://github.com/vididataset/VIDI。
引用
@article{arxiv.2205.13277,
title = {VIDI: A Video Dataset of Incidents},
author = {Duygu Sesver and Alp Eren Gençoğlu and Çağrı Emre Yıldız and Zehra Günindi and Faeze Habibi and Ziya Ata Yazıcı and Hazım Kemal Ekenel},
journal= {arXiv preprint arXiv:2205.13277},
year = {2023}
}