中文

DGGAN:用于三维手姿估计中 RGB 与深度图像解耦的深度图像引导生成对抗网络

计算机视觉与模式识别 2020-12-08 v1

摘要

从 RGB 图像估计三维手姿对广泛的潜在应用至关重要,但由于从 RGB 图像推断深度信息存在 substantial 模糊性而具有挑战性。最先进的估计器通过在训练期间正则化三维手姿估计模型以强制预测的三维姿态与真实深度图之间的一致性来解决此问题。然而,这些估计器在训练时依赖 RGB 图像与配对的深度图。在本研究中,我们提出一种条件生成对抗网络(GAN)模型,称为深度图像引导 GAN(DGGAN),以基于输入 RGB 图像生成逼真的深度图,并利用合成的深度图正则化三维手姿估计模型,从而消除对真实深度图的需求。在多个基准数据集上的实验结果表明,DGGAN 生成的深度图在正则化姿态估计模型方面十分有效,在估计精度上取得了新的最先进结果,在 RHD、STB 与 MHP 数据集上分别显著降低了平均三维端点误差(EPE)4.7%、16.5% 与 6.8%。

关键词

引用

@article{arxiv.2012.03197,
  title  = {DGGAN: Depth-image Guided Generative Adversarial Networks for Disentangling RGB and Depth Images in 3D Hand Pose Estimation},
  author = {Liangjian Chen and Shih-Yao Lin and Yusheng Xie and Yen-Yu Lin and Wei Fan and Xiaohui Xie},
  journal= {arXiv preprint arXiv:2012.03197},
  year   = {2020}
}