中文

从真实场景图像集合中无监督学习3D形状

计算机视觉与模式识别 2018-11-28 v2

摘要

我们提出一种直接从图像集合学习物体3D表面的方法。先前工作通过利用额外的手动标注(如物体姿态、3D表面模板、视频的时间连续性、手动选取的地标以及前景/背景掩码)来实现该能力。相比之下,我们的方法不使用任何此类标注。而是构建一个生成模型,即卷积神经网络,该网络在给定噪声向量样本时,输出物体的3D表面、纹理以及背景图像。这3个分量与额外的随机视角向量一起被送入可微渲染器,以生成所采样物体与背景的视图。我们的总体原则是:若渲染器的输出(即生成图像)是逼真的,则其输入(即生成的3D与纹理)也应是逼真的。为实现逼真性,生成模型通过与判别器进行对抗训练,判别器试图区分渲染器输出与给定数据集中的真实图像。此外,我们的生成模型可与编码器配对并作为自编码器训练,以自动提取图像中物体的3D形状、纹理和姿态。我们训练的生成模型与编码器在真实和合成数据上均展现出有前景的结果,首次证明了从图像集合进行完全无监督的3D学习是可行的。

关键词

引用

@article{arxiv.1811.10519,
  title  = {Unsupervised 3D Shape Learning from Image Collections in the Wild},
  author = {Attila Szabó and Paolo Favaro},
  journal= {arXiv preprint arXiv:1811.10519},
  year   = {2018}
}