中文

用于手部姿态估计的稠密三维回归

计算机视觉与模式识别 2017-11-27 v1

摘要

我们提出一种从单张深度帧进行三维手部姿态估计的简洁有效方法。与先前基于整体三维回归的 SOTA 方法不同,我们的方法致力于稠密逐像素估计。这通过姿态参数化中的审慎设计选择实现,其利用了深度图的二维与三维属性。具体而言,我们将姿态参数分解为一组逐像素估计,即 2D 热图、3D 热图与单位三维方向向量场。2D/3D 关节热图与 3D 关节偏移通过多任务网络级联估计,并以端到端方式训练。逐像素估计可直接转化为投票施放机制。随后采用均值漂移的一种变体聚合局部投票,同时依设计在估计的三维姿态与逐像素二维及三维估计间强制共识。我们的方法高效且高度准确。在 MSRA 与 NYU 手部数据集上,我们的方法大幅优于所有先前 SOTA 方法。在 ICVL 手部数据集上,我们的方法相较当前提出的近乎饱和结果取得相似精度,并优于其他多种已提方法。代码可于 \href\href{"https://github.com/melonwan/denseReg"}{\text{online}} 获取。

关键词

引用

@article{arxiv.1711.08996,
  title  = {Dense 3D Regression for Hand Pose Estimation},
  author = {Chengde Wan and Thomas Probst and Luc Van Gool and Angela Yao},
  journal= {arXiv preprint arXiv:1711.08996},
  year   = {2017}
}