PanoDreamer:一致的文本到360度场景生成
计算机视觉与模式识别
2025-04-08 v1
摘要
自动从文本描述、参考图像或两者的组合生成完整3D场景在虚拟现实和游戏等领域具有重要应用价值。然而,现有方法常常生成低质量的纹理和不一致的3D结构,尤其是在显著超出参考图像视场范围时。为此,我们提出PanoDreamer——一个用于一致的、具有灵活文本和图像控制的3D场景生成框架。我们的方法采用大型语言模型和warp-refine流水线,首先生成初始图像集合,然后将其合成为360度全景图。该全景图随后被提升到3D以形成初始点云。我们随后使用多种方法从不同视角生成与初始点云一致的额外图像,并扩展/细化初始点云。给定最终图像集合,我们利用3D Gaussian Splatting创建最终3D场景,可从不同视角进行渲染。实验表明,PanoDreamer在生成高质量、几何一致的3D场景方面有效。
引用
@article{arxiv.2504.05152,
title = {PanoDreamer: Consistent Text to 360-Degree Scene Generation},
author = {Zhexiao Xiong and Zhang Chen and Zhong Li and Yi Xu and Nathan Jacobs},
journal= {arXiv preprint arXiv:2504.05152},
year = {2025}
}
备注
Accepted by CVPR 2025 Workshop on Computer Vision for Metaverse