用于手部姿态估计的稠密三维回归
计算机视觉与模式识别
2017-11-27 v1
摘要
我们提出一种从单张深度帧进行三维手部姿态估计的简洁有效方法。与先前基于整体三维回归的 SOTA 方法不同,我们的方法致力于稠密逐像素估计。这通过姿态参数化中的审慎设计选择实现,其利用了深度图的二维与三维属性。具体而言,我们将姿态参数分解为一组逐像素估计,即 2D 热图、3D 热图与单位三维方向向量场。2D/3D 关节热图与 3D 关节偏移通过多任务网络级联估计,并以端到端方式训练。逐像素估计可直接转化为投票施放机制。随后采用均值漂移的一种变体聚合局部投票,同时依设计在估计的三维姿态与逐像素二维及三维估计间强制共识。我们的方法高效且高度准确。在 MSRA 与 NYU 手部数据集上,我们的方法大幅优于所有先前 SOTA 方法。在 ICVL 手部数据集上,我们的方法相较当前提出的近乎饱和结果取得相似精度,并优于其他多种已提方法。代码可于 获取。
引用
@article{arxiv.1711.08996,
title = {Dense 3D Regression for Hand Pose Estimation},
author = {Chengde Wan and Thomas Probst and Luc Van Gool and Angela Yao},
journal= {arXiv preprint arXiv:1711.08996},
year = {2017}
}