MEVA:用于活动检测的大规模多视角多模态视频数据集
计算机视觉与模式识别
2020-12-03 v1
摘要
我们提出多视角扩展活动视频(MEVA)数据集,一个用于人体活动识别的新的超大规模数据集。现有的安防数据集要么通过聚合因内容而公开的公共视频来关注活动计数,这通常排除了同场景背景视频,要么通过观测公共区域来实现持续性,从而无法控制活动内容。我们的数据集包含超过9300小时未剪辑的连续视频,经脚本设计以包含多样的同时发生的活动,以及自发的背景活动。我们已为37种活动类型标注了144小时,标记了参与者与道具的边界框。我们的采集在受访问控制的场地内约三周时间内观察了约100名演员表演脚本场景与自发背景活动,以重叠与非重叠的室内外视角多模态采集。所得数据包括来自38个RGB与热红外相机的视频、42小时无人机镜头,以及演员的GPS位置。122小时标注被封存以支持NIST扩展视频活动(ActEV)挑战;其余22小时标注及对应视频发布于我们的网站,同时附有额外的306小时地面相机数据、4.6小时无人机数据与9.6小时GPS日志。额外的派生数据包括将室外相机地理配准的相机模型以及室外场景的稠密3D点云模型。数据在IRB监督与批准下收集,并以CC-BY-4.0许可发布。
引用
@article{arxiv.2012.00914,
title = {MEVA: A Large-Scale Multiview, Multimodal Video Dataset for Activity Detection},
author = {Kellie Corona and Katie Osterdahl and Roderic Collins and Anthony Hoogs},
journal= {arXiv preprint arXiv:2012.00914},
year = {2020}
}
备注
9 pages, 11 figures, to appear at WACV 2021. Dataset is available at https://mevadata.org