中文

JGR-P2O:基于联合图推理的像素到偏移预测网络用于单张深度图像的 3D 手部姿态估计

计算机视觉与模式识别 2020-07-13 v2

摘要

基于单张深度图像的最先进的 3D 手部姿态估计方法均基于密集预测,包括体素到体素预测、点到点回归和逐像素估计。尽管性能良好,这些方法本质上存在一些问题,例如精度与效率之间的权衡不佳,以及使用局部卷积的平凡特征表示学习。在本文中,提出了一种新的基于逐像素预测的方法来解决上述问题。其核心思想有两方面:a) 显式建模关节之间的依赖关系以及像素与关节之间的关系,以更好地学习局部特征表示;b) 统一密集的逐像素偏移预测和直接关节回归以进行端到端训练。具体而言,我们首先提出一个基于图卷积网络 (GCN) 的关节图推理模块,以建模关节之间的复杂依赖关系并增强每个像素的表示能力。然后,我们密集估计所有像素在图像平面和深度空间中到关节的偏移,并通过对所有像素的预测进行加权平均来计算关节位置,完全摒弃了复杂的后处理操作。所提模型以高效的 2D 全卷积网络 (FCN) 主干实现,仅有约 1.4M 参数。在多个 3D 手部姿态估计基准上的大量实验表明,所提方法在单张 NVIDIA 1080Ti GPU 上以约 110fps 的速度高效运行的同时,实现了新的最先进精度。

关键词

引用

@article{arxiv.2007.04646,
  title  = {JGR-P2O: Joint Graph Reasoning based Pixel-to-Offset Prediction Network for 3D Hand Pose Estimation from a Single Depth Image},
  author = {Linpu Fang and Xingyan Liu and Li Liu and Hang Xu and Wenxiong Kang},
  journal= {arXiv preprint arXiv:2007.04646},
  year   = {2020}
}

备注

Accepted by ECCV2020 as a Spotlight paper