中文

基于自然图像的 3D 手部形状与姿态估计

计算机视觉与模式识别 2019-02-12 v1 人工智能 机器学习

摘要

本工作提出了一种首个基于端到端深度学习的方法,能够从自然图像(in the wild)中的 RGB 图像同时预测 3D 手部形状和姿态。我们的网络由一个深度卷积编码器和一个固定的基于模型的解码器拼接而成。给定一张输入图像,以及可选地由独立 CNN 获得的 2D 关节点检测结果,编码器预测一组手部参数和视角参数。解码器包含两个组件:一个是预计算的铰接式网格变形手部模型,根据手部参数生成 3D 网格;另一个是由视角参数控制的重投影模块,将生成的手部投影到图像域中。我们表明,在深度学习框架内利用手部模型中编码的形状和姿态先验知识,在标准基准测试上的图像 3D 姿态预测任务中取得了 SOTA 性能,并生成了几何有效且合理的 3D 重建。此外,我们表明,在自然图像数据集上以 2D 关节点标注形式的弱监督,结合在有限可用数据集上以 3D 关节点标注形式的全监督,能够使模型对自然图像的 3D 形状和姿态预测具有良好的泛化能力。

关键词

引用

@article{arxiv.1902.03451,
  title  = {3D Hand Shape and Pose from Images in the Wild},
  author = {Adnane Boukhayma and Rodrigo de Bem and Philip H. S. Torr},
  journal= {arXiv preprint arXiv:1902.03451},
  year   = {2019}
}