中文

基于单一 RGB 相机的联合三维姿态估计与动作识别统一深度框架

计算机视觉与模式识别 2019-07-17 v1

摘要

我们提出了一种基于深度学习的多任务框架,用于从 RGB 视频序列中联合进行三维人体姿态估计和动作识别。我们的方法分为两个阶段。在第一阶段,我们运行实时二维姿态检测器以确定身体重要关键点的精确像素位置。然后设计并训练一个双流神经网络,将检测到的二维关键点映射到三维姿态。在第二阶段,我们部署高效神经架构搜索(Efficient Neural Architecture Search, ENAS)算法来寻找最优网络架构,该架构通过基于图像的中间表示对估计的三维姿态的时空演化进行建模并执行动作识别。在 Human3.6M、MSR Action3D 和 SBU Kinect Interaction 数据集上的实验验证了所提方法在目标任务上的有效性。此外,我们表明我们的方法在训练和推理时需要较低的计算开销。

关键词

引用

@article{arxiv.1907.06968,
  title  = {A Unified Deep Framework for Joint 3D Pose Estimation and Action Recognition from a Single RGB Camera},
  author = {Huy Hieu Pham and Houssam Salmane and Louahdi Khoudour and Alain Crouzil and Pablo Zegers and Sergio A Velastin},
  journal= {arXiv preprint arXiv:1907.06968},
  year   = {2019}
}