中文

基于深度图像的实时卷积网络人体姿态估计

计算机视觉与模式识别 2019-10-31 v1

摘要

我们提议将最近的卷积神经网络(CNN)模型与深度成像相结合,以获得一种可靠且快速的多人姿态估计算法,适用于人机交互(HRI)场景。我们的假设是,深度图像包含的结构比RGB图像少且更易于处理,同时保留了人体检测和姿态推断所需的信息,从而允许使用该任务更简单的网络。我们的贡献有三方面。(i)我们提出了一种基于残差块(称为RPM)的从深度图像进行身体关键点定位的快速高效网络;(ii)我们创建了一个公开数据集DIH,包含超过17万张具有不同形状和视角的合成人体图像,以及用于评估的真实(已标注)数据;(iii)我们表明,我们的模型从零开始在合成数据上训练即可在真实数据上表现良好,获得与用预训练网络初始化的更大模型相似的结果。因此,它在性能和计算之间提供了良好的权衡。在真实数据上的实验证明了我们方法的有效性。

关键词

引用

@article{arxiv.1910.13911,
  title  = {Real-time Convolutional Networks for Depth-based Human Pose Estimation},
  author = {Angel Martínez-González and Michael Villamizar and Olivier Canévet and Jean-Marc Odobez},
  journal= {arXiv preprint arXiv:1910.13911},
  year   = {2019}
}

备注

Published in IROS 2018