GAUDI:一种用于沉浸式三维场景生成的神经架构
计算机视觉与模式识别
2022-07-29 v1 图形学
机器学习
摘要
我们介绍了 GAUDI,一种能够捕捉复杂且真实的三维场景分布、并可由运动相机沉浸式渲染的生成模型。我们以可扩展且强大的方法解决这一具有挑战性的问题:首先优化一种将辐射场与相机位姿解耦的潜在表示,随后利用该潜在表示学习一个生成模型,从而实现三维场景的无条件与条件生成。我们的模型推广了先前聚焦于单一物体的工作,去除了相机位姿分布可在样本间共享的假设。我们表明,GAUDI 在多个数据集上的无条件生成设定中取得了最先进的性能,并允许在给定稀疏图像观测或描述场景的文本等条件变量下对三维场景进行条件生成。
引用
@article{arxiv.2207.13751,
title = {GAUDI: A Neural Architect for Immersive 3D Scene Generation},
author = {Miguel Angel Bautista and Pengsheng Guo and Samira Abnar and Walter Talbott and Alexander Toshev and Zhuoyuan Chen and Laurent Dinh and Shuangfei Zhai and Hanlin Goh and Daniel Ulbricht and Afshin Dehghan and Josh Susskind},
journal= {arXiv preprint arXiv:2207.13751},
year = {2022}
}
备注
Project webpage: https://github.com/apple/ml-gaudi