中文

通过耦合三维游戏引擎与概率图模型生成人体动作视频

计算机视觉与模式识别 2019-10-16 v1 机器学习 多媒体

摘要

近年来深度视频动作识别模型取得了极高的成功率,但需要大量人工标注数据,而这类数据的获取昂贵且费力。在本工作中,我们研究用于视频动作识别的合成训练数据生成,因为合成数据已成功用于监督多种其他计算机视觉任务的模型。我们提出了一种可解释的人体动作视频参数化生成模型,该模型依赖于程序化生成、物理模型以及现代游戏引擎的其他组件。利用该模型,我们生成了一个多样、真实且物理上合理的人体动作视频数据集,称为 PHAV(Procedural Human Action Videos,程序化人体动作视频)。PHAV 共包含 39,982 个视频,35 个动作类别每个均有超过 1,000 个样本。我们的视频生成方法不限于已有的动作捕捉序列:这 35 个类别中有 14 个是程序化定义的合成动作。此外,每个视频以 6 种不同的数据模态表示,包括 RGB、光流和像素级语义标签。这些模态利用现代 GPU 的多重渲染目标(Multiple Render Targets)特性几乎同时生成。为利用 PHAV,我们引入了一种深度多任务(即考虑来自多个数据集的动作类别)表示学习架构,能够同时从合成与真实视频数据集中学习,即使它们的动作类别不同。我们在 UCF-101 和 HMDB-51 基准上的实验表明,将我们的大规模合成视频与小型真实世界数据集结合可提升识别性能。我们的方法还显著优于通过微调最先进的视频无监督生成模型所产生的视频表示。

关键词

引用

@article{arxiv.1910.06699,
  title  = {Generating Human Action Videos by Coupling 3D Game Engines and Probabilistic Graphical Models},
  author = {César Roberto de Souza and Adrien Gaidon and Yohann Cabon and Naila Murray and Antonio Manuel López},
  journal= {arXiv preprint arXiv:1910.06699},
  year   = {2019}
}

备注

Pre-print of the article accepted for publication in the Special Issue on Generating Realistic Visual Data of Human Behavior of the International Journal of Computer Vision (IJCV). arXiv admin note: substantial text overlap with arXiv:1612.00881