中文

基于卷积神经网络的视频实时人体姿态估计

计算机视觉与模式识别 2016-09-26 v1

摘要

在本文中,我们提出一种利用卷积神经网络从视频中进行实时多人人体姿态估计的方法。我们的方法面向特定用例应用,其中良好精度至关重要且背景与姿态变化有限。这使我们能够使用通用网络架构,其既准确又快速。我们将问题分为两个阶段:(1)预训练与(2)微调。在预训练中,网络使用来自公开数据集的高度多样化输入数据学习,而在微调中,我们使用以Kinect记录的应用特定数据进行训练。我们的方法与大多数最先进方法的不同之处在于,我们考虑了整个系统,包括人体检测器、姿态估计器以及一种用于记录微调用应用特定训练材料的自动方式。我们的方法比许多最先进方法显著更快。我们的方法可被视为Kinect的替代品,并可用于更高层次任务,如手势控制、游戏、人体跟踪、动作识别与动作跟踪。我们利用应用特定数据达到了96.8\% ([email protected])的精度。

关键词

引用

@article{arxiv.1609.07420,
  title  = {Real-time Human Pose Estimation from Video with Convolutional Neural Networks},
  author = {Marko Linna and Juho Kannala and Esa Rahtu},
  journal= {arXiv preprint arXiv:1609.07420},
  year   = {2016}
}

备注

16 pages