中文

面向深度三维手部姿态估计的良好实践

计算机视觉与模式识别 2017-07-25 v1

摘要

从单张深度图像进行三维手部姿态估计是人机交互中一个重要且具有挑战性的问题。近来,设计精巧的深度卷积网络已被用于解决该问题,但相较于传统的基于随机森林的方法,其改进并不明显。为了挖掘良好实践并提升手部姿态估计的性能,我们提出了一种用于直接三维坐标回归的树状结构区域集成网络。该网络首先将卷积网络的最后卷积输出划分为若干网格区域。然后,每个区域上独立的全连接回归器的结果由另一个全连接层整合以执行估计。通过利用包括数据增强和平滑 L1L_1 损失在内的多种训练策略,所提出的区域集成网络能显著提升卷积网络定位手部关节的性能。实验结果表明,我们的方法在三个公开手部姿态数据集上取得了当前最优算法中的最佳性能。我们还在指尖检测和人体姿态数据集上实验了我们的方法,并获得了当前最优的精度。

关键词

引用

@article{arxiv.1707.07248,
  title  = {Towards Good Practices for Deep 3D Hand Pose Estimation},
  author = {Hengkai Guo and Guijin Wang and Xinghao Chen and Cairong Zhang},
  journal= {arXiv preprint arXiv:1707.07248},
  year   = {2017}
}

备注

Extended version of arXiv:1702.02447