RealmDreamer: 基于修复和深度扩散的文本驱动3D场景生成
计算机视觉与模式识别
2025-03-12 v2 人工智能
图形学
机器学习
摘要
我们介绍RealmDreamer,一种从文本描述生成前向3D场景的技术。我们的方法使用预训练的扩散模型优化3D高斯泼溅表示以匹配复杂的文本提示。我们的关键见解是利用基于初始场景估计的2D修复扩散模型,为3D蒸馏过程中未知区域提供低方差监督。同时,我们通过深度扩散模型的几何蒸馏赋予高保真几何,该模型以修复模型的样本为条件。我们发现优化的初始化至关重要,并为此提供了原则性的方法论。值得注意的是,我们的技术不需要视频或多视图数据,可以合成各种高质量、不同风格、具有复杂布局的3D场景。此外,我们方法的通用性允许从单张图像进行3D合成。根据一项全面的用户研究,我们的方法优于所有现有方法,偏好率为88-95%。项目页面:https://realmdreamer.github.io/
引用
@article{arxiv.2404.07199,
title = {RealmDreamer: Text-Driven 3D Scene Generation with Inpainting and Depth Diffusion},
author = {Jaidev Shriram and Alex Trevithick and Lingjie Liu and Ravi Ramamoorthi},
journal= {arXiv preprint arXiv:2404.07199},
year = {2025}
}
备注
Published at 3DV 2025