中文

BlockGAN:从无标签图像中学习三维物体感知的场景表示

计算机视觉与模式识别 2020-12-03 v4

摘要

我们提出 BlockGAN,一种直接从无标签二维图像中学习物体感知的三维场景表示的图像生成模型。当前关于场景表示学习的工作要么忽略场景背景,要么将整个场景视为单一物体。同时,考虑场景组合性的工作仅将场景物体视为带有 alpha 图的图像块或二维图层。受计算机图形学管线启发,我们设计 BlockGAN 以学习先生成背景与前景物体的三维特征,再将它们组合为整个场景的三维特征,最终渲染为真实图像。这使得 BlockGAN 能够推理物体外观之间的遮挡与交互(如阴影与光照),并提供对每个物体的三维位姿与身份的控制,同时保持图像真实感。BlockGAN 以端到端方式训练,仅使用无标签单张图像,无需三维几何、位姿标签、物体掩码或同一场景的多视图。我们的实验表明,使用显式三维特征表示物体使 BlockGAN 能够学习在物体(前景与背景)及其属性(位姿与身份)上均解耦的表示。

关键词

引用

@article{arxiv.2002.08988,
  title  = {BlockGAN: Learning 3D Object-aware Scene Representations from Unlabelled Images},
  author = {Thu Nguyen-Phuoc and Christian Richardt and Long Mai and Yong-Liang Yang and Niloy Mitra},
  journal= {arXiv preprint arXiv:2002.08988},
  year   = {2020}
}

备注

For project page, see https://www.monkeyoverflow.com/#/blockgan/ Accepted to Conference on Neural Information Processing Systemsm, NeurIPS 2020