中文

V2V-PoseNet:用于从单张深度图精确估计三维手部和人体姿态的体素到体素预测网络

计算机视觉与模式识别 2018-08-17 v3

摘要

现有大多数基于深度学习的从单张深度图估计三维手部和人体姿态的方法都基于一个通用框架:输入二维深度图,并通过二维卷积神经网络(CNNs)直接回归关键点(如手部或人体关节)的三维坐标。该方法的第一个缺陷是二维深度图中存在透视畸变。虽然深度图本质上是三维数据,但许多先前方法将深度图当作二维图像处理,通过从三维到二维空间的投影扭曲了实际物体的形状。这迫使网络执行透视畸变不变的估计。传统方法的第二个缺陷是,从二维图像直接回归三维坐标是一种高度非线性的映射,给学习过程带来困难。为克服这些缺陷,我们首先将从单张深度图的三维手部和人体姿态估计问题转化为体素到体素预测,该方法使用三维体素化网格并估计每个关键点逐体素的可能性。我们将模型设计为三维 CNN,在实时运行的同时提供准确估计。我们的系统在几乎所有公开的三维手部和人体姿态估计数据集上优于先前方法,并在 HANDS 2017 基于帧的三维手部姿态估计挑战赛中夺得第一。代码见 https://github.com/mks0601/V2V-PoseNet_RELEASE。

关键词

引用

@article{arxiv.1711.07399,
  title  = {V2V-PoseNet: Voxel-to-Voxel Prediction Network for Accurate 3D Hand and Human Pose Estimation from a Single Depth Map},
  author = {Gyeongsik Moon and Ju Yong Chang and Kyoung Mu Lee},
  journal= {arXiv preprint arXiv:1711.07399},
  year   = {2018}
}

备注

HANDS 2017 Challenge Frame-based 3D Hand Pose Estimation Winner (ICCV 2017), Published at CVPR 2018