Moments in Time 数据集:用于事件理解的一百万视频
计算机视觉与模式识别
2019-02-19 v3 人工智能
摘要
我们提出了 Moments in Time 数据集,这是一个大规模人工标注的、包含一百万个对应三秒内展开的动态事件的短视频集合。即便对于发生在3秒视频中的动作,对其空间-音频-时间动态进行建模也面临诸多挑战:有意义的事件不仅包括人,还包括物体、动物和自然现象;视觉与听觉事件可能在时间上对称(“打开”反向即为“关闭”),且既可能是瞬时的也可能是持续的。我们描述了该数据集的标注过程(每个视频在339个不同类别中被标记为一个动作或活动标签),将其规模与多样性与其他用于动作识别的大规模视频数据集进行比较,并报告了分别及联合处理空间、时间和听觉三种模态的若干基线模型的结果。Moments in Time 数据集旨在对视觉和听觉模态中的事件具有广泛的覆盖与多样性,可作为一项新挑战,用于开发在复杂度和抽象推理水平上达到人类日常处理能力的模型。
引用
@article{arxiv.1801.03150,
title = {Moments in Time Dataset: one million videos for event understanding},
author = {Mathew Monfort and Alex Andonian and Bolei Zhou and Kandan Ramakrishnan and Sarah Adel Bargal and Tom Yan and Lisa Brown and Quanfu Fan and Dan Gutfruend and Carl Vondrick and Aude Oliva},
journal= {arXiv preprint arXiv:1801.03150},
year = {2019}
}