中文

用于从合成图像学习快速准确三维姿态推断的特征映射

计算机视觉与模式识别 2018-03-28 v2

摘要

我们提出一种简单高效的方法,在训练深度网络从图像预测三维姿态时利用合成图像。使用合成图像训练深度网络的能力极具价值,因为易于创建由此类图像组成的几乎无限的训练集,而采集和标注真实图像可能非常繁琐。然而,合成图像与真实图像并不完全一致,将其用于训练可能导致次优性能。最近研究表明,对于基于样本的方法,可以学习从真实图像的样本表示到合成图像的样本表示的映射。在本文中,我们表明该方法更具一般性,网络也可应用于映射之后推断三维姿态:在运行时,给定目标对象的真实图像,我们首先计算该图像的特征,将其映射到合成图像的特征空间,最后将所得特征作为另一个预测三维姿态网络的输入。由于该网络可利用合成图像非常有效地训练,其在实践中表现非常好,且推断比基于样本的方法更快更准确。我们在LINEMOD数据集(基于彩色图像的三维物体姿态估计)和NYU数据集(基于深度图的三维手部姿态估计)上演示了我们的方法。我们表明其使我们能在两个数据集上均超越当前最优(state-of-the-art)。

关键词

引用

@article{arxiv.1712.03904,
  title  = {Feature Mapping for Learning Fast and Accurate 3D Pose Inference from Synthetic Images},
  author = {Mahdi Rad and Markus Oberweger and Vincent Lepetit},
  journal= {arXiv preprint arXiv:1712.03904},
  year   = {2018}
}

备注

CVPR 2018