基于布局学习的解耦 3D 场景生成
计算机视觉与模式识别
2024-02-28 v1 机器学习
摘要
我们介绍了一种生成 3D 场景的方法,这些场景被解耦为其组成对象。这种解耦是无监督的,仅依赖于大型预训练文本到图像模型的知识。我们的关键见解是,可以通过寻找 3D 场景中那些在空间重排后仍能产生同一场景有效配置的部分来发现对象。具体而言,我们的方法从头开始联合优化多个 NeRF——每个代表其自身的对象——以及一组将这些对象合成为场景的布局。随后,我们鼓励这些合成场景符合图像生成器的分布。我们表明,尽管方法简单,但我们的方法成功生成了分解为独立对象的 3D 场景,从而实现了文本到 3D 内容创作的新能力。有关结果和交互式演示,请访问我们的项目页面:https://dave.ml/layoutlearning/
引用
@article{arxiv.2402.16936,
title = {Disentangled 3D Scene Generation with Layout Learning},
author = {Dave Epstein and Ben Poole and Ben Mildenhall and Alexei A. Efros and Aleksander Holynski},
journal= {arXiv preprint arXiv:2402.16936},
year = {2024}
}