中文

跨模态深度变分手部姿态估计

计算机视觉与模式识别 2018-04-02 v1

摘要

人手以复杂且高维的方式运动,使得仅从图像估计3D手部姿态配置成为一项具有挑战性的任务。在本工作中,我们提出了一种方法,通过生成式深度神经网络学习由跨模态训练的潜空间表示的统计手部模型。我们从VAE框架的变分下界推导出目标函数,并联合优化所得的跨模态KL散度与后验重建目标,自然地形成了一种训练机制,使得在RGB图像、2D关键点检测或3D手部配置等多种模态间产生连贯的潜空间。此外,该方法提供了一种直接的半监督使用方式。该潜空间可直接用于从RGB图像估计3D手部姿态,在不同设置下均优于现有技术。进一步地,我们表明所提出的方法无需修改即可应用于深度图像,且性能与专用方法相当。最后,该模型是完全生成式的,能够跨模态合成一致的手部配置对。我们在RGB和深度数据集上评估了该方法,并定性分析了其潜空间。

关键词

引用

@article{arxiv.1803.11404,
  title  = {Cross-modal Deep Variational Hand Pose Estimation},
  author = {Adrian Spurr and Jie Song and Seonwook Park and Otmar Hilliges},
  journal= {arXiv preprint arXiv:1803.11404},
  year   = {2018}
}