HandVoxNet++:基于体素的神经网络的三维手形与姿态估计
计算机视觉与模式识别
2021-12-07 v2
摘要
从单张深度图估计三维手形与姿态是一项新颖且具有挑战性的计算机视觉问题,有着诸多应用。现有方法直接通过二维卷积神经网络回归手部网格,因图像中的透视畸变而产生伪影。为克服现有方法的局限,我们开发了 HandVoxNet++,即一种以全监督方式训练的、带三维与图卷积的基于体素的深度网络。我们网络的输入是基于截断符号距离函数(TSDF)的三维体素化深度图。HandVoxNet++ 依赖两种手形表示。其一是三维体素化手形网格,它不保持网格拓扑且是最精确的表示。其二是保持网格拓扑的手部表面。我们通过将手部表面对齐到体素化手形,来结合两种表示的优势,所用方法或为基于神经图卷积的网格配准(GCN-MeshReg),或为不依赖训练数据的经典分段非刚性引力法(NRGA++)。在三个公开基准(即 SynHand5M、基于深度的 HANDS19 挑战赛与 HO-3D)的广泛评估中,所提 HandVoxNet++ 达到了最先进的性能。在本发表于 CVPR 2020 的先前方法的期刊扩展版中,我们在 SynHand5M 与 HANDS19 数据集上分别获得了 41.09% 与 13.7% 更高的形状对齐精度。我们的方法在 2020 年 8 月向门户提交结果时,于 HANDS19 挑战赛数据集(任务 1:基于深度的三维手部姿态估计)上排名第一。
引用
@article{arxiv.2107.01205,
title = {HandVoxNet++: 3D Hand Shape and Pose Estimation using Voxel-Based Neural Networks},
author = {Jameel Malik and Soshi Shimada and Ahmed Elhayek and Sk Aziz Ali and Christian Theobalt and Vladislav Golyanik and Didier Stricker},
journal= {arXiv preprint arXiv:2107.01205},
year = {2021}
}
备注
13 pages, 6 tables, 7 figures; project webpage: http://4dqv.mpi-inf.mpg.de/HandVoxNet++/. arXiv admin note: text overlap with arXiv:2004.01588