中文

AVA:时空定位的原子视觉动作视频数据集

计算机视觉与模式识别 2018-05-01 v4

摘要

本文介绍了一个时空定位的原子视觉动作 (AVA) 视频数据集。AVA 数据集在 430 个 15 分钟的视频片段中密集标注了 80 个原子视觉动作,这些动作在空间和时间上被定位,产生了 1.58M 个动作标签,且每个人通常具有多个标签。我们数据集的关键特征是:(1) 原子视觉动作而非复合动作的定义;(2) 精确的时空标注,每个人可能有多个标注;(3) 在 15 分钟的视频片段中对这些原子动作的详尽标注;(4) 在连续片段中跨时间段链接的人物;(5) 使用电影来收集多样化的动作表示。这不同于现有的时空动作识别数据集,后者通常在短视频片段中为复合动作提供稀疏标注。我们将公开发布该数据集。AVA 凭借其真实的场景和动作复杂性,揭示了动作识别的内在困难。为了对此进行基准测试,我们提出了一种基于当前最先进方法的新型动作定位方法,并在 JHMDB 和 UCF101-24 类别上展示了更好的性能。虽然在现有数据集上创造了新的技术水准,但在 AVA 上的总体结果较低,为 15.6% mAP,凸显了开发视频理解新方法的需求。

关键词

引用

@article{arxiv.1705.08421,
  title  = {AVA: A Video Dataset of Spatio-temporally Localized Atomic Visual Actions},
  author = {Chunhui Gu and Chen Sun and David A. Ross and Carl Vondrick and Caroline Pantofaru and Yeqing Li and Sudheendra Vijayanarasimhan and George Toderici and Susanna Ricco and Rahul Sukthankar and Cordelia Schmid and Jitendra Malik},
  journal= {arXiv preprint arXiv:1705.08421},
  year   = {2018}
}

备注

To appear in CVPR 2018. Check dataset page https://research.google.com/ava/ for details