中文

BlobGAN-3D:一种用于室内场景的空间解耦三维感知生成模型

计算机视觉与模式识别 2023-03-28 v1

摘要

三维感知图像合成因对真实世界三维本质的建模而受到越来越多的关注。然而,在多物体场景下对生成图像进行逼真的物体级编辑仍然是一个挑战。最近,一种称为BlobGAN的二维GAN在真实世界室内场景数据集上展示了强大的多物体编辑能力。在这项工作中,我们提出了BlobGAN-3D,它是原始二维BlobGAN的三维感知改进版。我们通过将二维blob扩展为三维blob,在实现显式相机位姿控制的同时保持场景中各个物体的解耦。我们保留了BlobGAN的物体级编辑能力,此外还允许对场景中物体的三维位置进行灵活控制。我们在真实世界室内数据集上测试了我们的方法,结果表明,与二维BlobGAN及其他三维感知GAN基线相比,我们的方法在具有挑战性的多物体真实世界场景中能够实现相当的的图像质量,同时支持相机位姿控制和物体级编辑。

关键词

引用

@article{arxiv.2303.14706,
  title  = {BlobGAN-3D: A Spatially-Disentangled 3D-Aware Generative Model for Indoor Scenes},
  author = {Qian Wang and Yiqun Wang and Michael Birsak and Peter Wonka},
  journal= {arXiv preprint arXiv:2303.14706},
  year   = {2023}
}