HandVoxNet: 基于深度体素的网络从单张深度图估计 3D 手部形状与姿态
计算机视觉与模式识别
2020-04-06 v1
摘要
从单张深度图进行 3D 手部形状与姿态估计是一个新颖且极具挑战性的计算机视觉问题,具有许多应用。现有最先进的方法通过 2D 卷积神经网络直接从 2D 深度图像回归 3D 手部网格,但由于图像中的透视畸变,这会导致估计结果中出现伪影。相比之下,我们提出了一种以弱监督方式训练的带有 3D 卷积的新颖架构。我们方法的输入是 3D 体素化深度图,并依赖于两种手部形状表示。第一种是形状的 3D 体素网格,它很精确,但不能保持网格拓扑和网格顶点数量。第二种表示是 3D 手部表面,其精度较低,但不受第一种表示局限性的影响。我们通过将手部表面配准到体素化手部形状来结合这两种表示的优势。在大量实验中,所提出的方法在 SynHand5M 数据集上比现有技术提高了 47.8%。此外,我们针对体素化深度图的增强策略进一步提高了在真实数据上 3D 手部姿态估计的准确性。与现有方法相比,我们的方法在 NYU 和 BigHand2.2M 数据集上产生了视觉上更合理、更逼真的手部形状。
引用
@article{arxiv.2004.01588,
title = {HandVoxNet: Deep Voxel-Based Network for 3D Hand Shape and Pose Estimation from a Single Depth Map},
author = {Jameel Malik and Ibrahim Abdelaziz and Ahmed Elhayek and Soshi Shimada and Sk Aziz Ali and Vladislav Golyanik and Christian Theobalt and Didier Stricker},
journal= {arXiv preprint arXiv:2004.01588},
year = {2020}
}
备注
10 pages, 8 figures, 5 tables, CVPR