中文

DAP3D-Net:视频中动作的位置、类别与方式

计算机视觉与模式识别 2016-02-11 v1

摘要

复杂场景视频中的动作解析是计算机视觉中一个有趣但具有挑战性的任务。本文中,我们提出一种以多任务学习方式训练的通用3D卷积神经网络,用于视频中有效的深度动作解析(DAP3D-Net)。特别地,在训练阶段,动作定位、分类与属性学习可通过DAP3D-Net在我们的表观-运动数据上联合优化。对于一个待测试的后续视频,我们可以同时将该视频中的每个单独动作描述为:动作发生于何处、动作是什么以及动作如何执行。为了充分证明所提DAP3D-Net的有效性,我们还贡献了一个新的多类别对齐合成动作数据集,即NASA,其包含200; 000个动作片段,涵盖超过300个类别,并具有两个层次级别的33个预定义动作属性(即基本身体部位运动的低层属性,以及与动作运动相关的高层属性)。我们使用NASA数据集学习DAP3D-Net,随后在我们收集的人的动作理解(Human Action Understanding, HAU)数据集上对其进行评估。实验结果表明,我们的方法能够准确地定位、分类并描述真实视频中的多个动作。

关键词

引用

@article{arxiv.1602.03346,
  title  = {DAP3D-Net: Where, What and How Actions Occur in Videos?},
  author = {Li Liu and Yi Zhou and Ling Shao},
  journal= {arXiv preprint arXiv:1602.03346},
  year   = {2016}
}