中文

逆图形学:从单幅图像无监督学习三维形状

计算机视觉与模式识别 2019-12-03 v2 机器学习 机器学习

摘要

利用生成模型进行逆图形学是一个活跃的研究领域。然而,多数工作聚焦于开发有监督与半监督方法的模型。本文研究从单幅图像无监督学习三维几何的问题。我们的方法是使用生成模型,将二维图像作为潜在三维体素网格的投影生成,并将其训练为变分自编码器或采用对抗方法。我们的贡献如下:首先,展示了如何从 MNIST 与 MNIST Fashion 等通用数据集以良好质量恢复三维形状与姿态。其次,比较了对抗与变分方法学习到的形状,对抗方法给出更稠密的三维形状。第三,探索将物体姿态建模为均匀分布以从单幅图像恢复三维形状的思路。我们在 CelebA 数据集 \cite{liu2015faceattributes} 上的实验证明,当物体沿一个或多个轴对称时,可从单幅图像恢复完整三维形状;而使用 ModelNet40 \cite{wu20153d} 所得结果显示了潜在副作用,即模型学习到的三维形状可从任意视角渲染同一图像。第四,提出一种通用端到端方法,通过将方位角等变化因素建模为独立潜变量,以完全无监督方式从单幅图像学习三维形状。我们的方法不对数据集作任何假设,可处理合成与真实图像(即真正意义上的无监督)。我们给出将模型以 μ\mu-VAE 目标 \cite{ucar2019bridging} 训练、并使用合并 MNIST、MNIST Fashion、CelebA 及 ModelNet40 六个类别所有图像的数据集所得结果。该模型能以良好质量学习三维形状与姿态,并利用跨所有数据集学习到的信息。

关键词

引用

@article{arxiv.1911.07937,
  title  = {Inverse Graphics: Unsupervised Learning of 3D Shapes from Single Images},
  author = {Talip Ucar},
  journal= {arXiv preprint arXiv:1911.07937},
  year   = {2019}
}

备注

10 pages, 15 figures. In the second version of the paper, a link to a demo site is added under Figure-12