中文

用于单张深度图像手部姿态估计的结构感知三维沙漏网络

计算机视觉与模式识别 2018-12-27 v1

摘要

本文提出了一种用于单张深度图像手部姿态估计的新型结构感知三维沙漏网络,在 MSRA 和 NYU 数据集上取得了 SOTA 结果。与现有执行图像到坐标回归的工作相比,我们的网络以三维体素作为输入,并直接为每个关节回归三维热力图。具体而言,我们使用沙漏网络作为骨干网络并将其修改为三维形式。我们以端到端的方式将树状指骨结构显式地建模到网络及损失函数中,以考虑骨架约束。通过简单的后处理,即可从体素密度图中轻松获得最终估计。实验结果表明,所提出的结构感知三维沙漏网络在 MSRA 和 NYU 数据集上分别实现了 7.4 mm 和 8.9 mm 的平均关节误差。

关键词

引用

@article{arxiv.1812.10320,
  title  = {Structure-Aware 3D Hourglass Network for Hand Pose Estimation from Single Depth Image},
  author = {Fuyang Huang and Ailing Zeng and Minhao Liu and Jing Qin and Qiang Xu},
  journal= {arXiv preprint arXiv:1812.10320},
  year   = {2018}
}

备注

BMVC 2018