中文

利用姿态、运动与外观的链式多流网络用于动作分类与检测

计算机视觉与模式识别 2017-05-30 v2 人工智能 人机交互 多媒体 神经与进化计算

摘要

通用的人类动作识别需要理解各种视觉线索。在本文中,我们提出了一种网络架构,用于计算并整合动作识别中最重要的视觉线索:姿态、运动和原始图像。为了进行整合,我们引入了一个逐步添加线索的 Markov 链模型。所得方法高效,适用于动作分类以及空间和时间动作定位。这两项贡献明显提升了各自基线的性能。整体方法在 HMDB51、J-HMDB 和 NTU RGB+D 数据集上取得了 SOTA 的动作分类性能。此外,它在 UCF101 和 J-HMDB 上获得了 SOTA 的时空动作定位结果。

关键词

引用

@article{arxiv.1704.00616,
  title  = {Chained Multi-stream Networks Exploiting Pose, Motion, and Appearance for Action Classification and Detection},
  author = {Mohammadreza Zolfaghari and Gabriel L. Oliveira and Nima Sedaghat and Thomas Brox},
  journal= {arXiv preprint arXiv:1704.00616},
  year   = {2017}
}

备注

10 pages, 7 figures, ICCV 2017 submission