中文

用于训练深度动作识别网络的视频程序化生成

计算机视觉与模式识别 2017-07-20 v2

摘要

视频中的人类动作识别深度学习正取得显著进展,但由于依赖对大量视频集合的昂贵人工标注而受到阻碍。在本研究中,我们研究了为动作识别生成合成训练数据,因为该方法最近在其他多种计算机视觉任务中展现出可喜的结果。我们提出了一种可解释的、参数化的人类动作视频生成模型,该模型依赖于现代游戏引擎的程序化生成和其他计算机图形学技术。我们生成了一个多样化、逼真且物理上合理的人类动作视频数据集,称为 PHAV(Procedural Human Action Videos,程序化人类动作视频)。它共包含 39,982 个视频,35 个类别的每个动作均有超过 1,000 个样本。我们的方法不局限于现有的动作捕捉序列,我们程序化地定义了 14 个合成动作。我们引入了一种深度多任务表示学习架构,以混合合成视频与真实视频,即使动作类别不同亦可进行。我们在 UCF101 和 HMDB51 基准上的实验表明,将我们的大量合成视频与小型真实世界数据集相结合可以提升识别性能,显著优于对最先进的视频无监督生成模型进行微调的方法。

关键词

引用

@article{arxiv.1612.00881,
  title  = {Procedural Generation of Videos to Train Deep Action Recognition Networks},
  author = {César Roberto de Souza and Adrien Gaidon and Yohann Cabon and Antonio Manuel López Peña},
  journal= {arXiv preprint arXiv:1612.00881},
  year   = {2017}
}

备注

Accepted for publication at CVPR 2017. http://adas.cvc.uab.es/phav/