中文

动作机:重新思考剪辑视频中的动作识别

计算机视觉与模式识别 2018-12-18 v2

摘要

现有视频动作识别方法大多不区分人体与环境,且容易对场景和物体过拟合。本文提出一个概念简单、通用且高性能的剪辑视频动作识别框架,旨在进行以人为中心的建模。该方法称为动作机(Action Machine),以人物边界框裁剪后的视频作为输入。它通过添加用于人体姿态估计的分支和用于基于姿态的动作识别的 2D CNN 来扩展膨胀 3D 卷积网络(I3D),训练与测试速度快。动作机可受益于动作识别与姿态估计的多任务训练,以及来自 RGB 图像与姿态的预测融合。在 NTU RGB-D 上,动作机在跨视角和跨主体下分别以 97.2% 和 94.3% 的 top-1 准确率取得最先进性能。动作机在另外三个较小的动作识别数据集上也取得了有竞争力的性能:Northwestern UCLA Multiview Action3D、MSR Daily Activity3D 和 UTD-MHAD。代码将公开。

关键词

引用

@article{arxiv.1812.05770,
  title  = {Action Machine: Rethinking Action Recognition in Trimmed Videos},
  author = {Jiagang Zhu and Wei Zou and Liang Xu and Yiming Hu and Zheng Zhu and Manyu Chang and Junjie Huang and Guan Huang and Dalong Du},
  journal= {arXiv preprint arXiv:1812.05770},
  year   = {2018}
}