MaGRITTe:基于图像、俯视图和文本的操控与生成式 3D 实现
计算机视觉与模式识别
2024-11-28 v2
摘要
根据用户指定条件生成 3D 场景为减轻 3D 应用中的制作负担提供了一条有前景的途径。由于控制条件有限,以往的研究需要付出大量努力才能实现所需的场景。我们提出了一种在多模态条件下控制和生成 3D 场景的方法,使用部分图像、以俯视图表示的布局信息以及文本提示。结合这些条件生成 3D 场景涉及以下重大困难:(1)大型数据集的创建,(2)多模态条件交互的反映,以及(3)布局条件的领域依赖性。我们将 3D 场景生成过程分解为从给定条件生成 2D 图像以及从 2D 图像生成 3D 场景。2D 图像生成是通过使用包含部分图像和布局的小型人工数据集微调预训练的文本到图像模型来实现的,而 3D 场景生成则是通过基于布局的条件深度估计和神经辐射场 (NeRF) 来实现的,从而避免了创建大型数据集。使用 360 度图像对空间信息进行通用表示,能够考虑多模态条件的交互作用,并降低了布局控制的领域依赖性。实验结果定性和定量地表明,所提出的方法能够根据多模态条件生成从室内到室外跨多种领域的 3D 场景。
引用
@article{arxiv.2404.00345,
title = {MaGRITTe: Manipulative and Generative 3D Realization from Image, Topview and Text},
author = {Takayuki Hara and Tatsuya Harada},
journal= {arXiv preprint arXiv:2404.00345},
year = {2024}
}
备注
Project Page: https://hara012.github.io/MaGRITTe-project