交叉网络:结合GAN与VAE利用共享潜在空间进行手姿态估计
计算机视觉与模式识别
2017-07-20 v2
摘要
从深度图像进行三维手姿态估计的最先进方法需要大量的标注训练数据。我们提出利用两个具有共享潜在空间的深度生成模型来建模三维手姿态与相应深度图像之间的统计关系。根据设计,我们的架构允许以半监督方式从非标注图像数据中学习。假设姿态与深度图之间存在一一映射,共享潜在空间中的任意给定点都可以被投影为手姿态及相应的深度图。然后,可通过学习一个判别器来估计给定某些深度图时潜在姿态的后验概率,从而回归手姿态。为了改善泛化并更好地利用未标注深度图,我们联合训练生成器和判别器。在每次迭代中,生成器利用来自判别器的反向传播梯度进行更新,以合成逼真的关节化手部深度图,而判别器则受益于由合成样本和未标注样本组成的增广训练集。所提出的判别器网络架构非常高效,在 CPU 上以 90 FPS 运行,且在 3 个公开基准上的精度可与最先进水平(SOTA)相当或更优。
引用
@article{arxiv.1702.03431,
title = {Crossing Nets: Combining GANs and VAEs with a Shared Latent Space for Hand Pose Estimation},
author = {Chengde Wan and Thomas Probst and Luc Van Gool and Angela Yao},
journal= {arXiv preprint arXiv:1702.03431},
year = {2017}
}
备注
10 pages, 5 figures, accepted in CVPR 2017