中文

PanoDreamer:一致的文本到360度场景生成

计算机视觉与模式识别 2025-04-08 v1

摘要

自动从文本描述、参考图像或两者的组合生成完整3D场景在虚拟现实和游戏等领域具有重要应用价值。然而,现有方法常常生成低质量的纹理和不一致的3D结构,尤其是在显著超出参考图像视场范围时。为此,我们提出PanoDreamer——一个用于一致的、具有灵活文本和图像控制的3D场景生成框架。我们的方法采用大型语言模型和warp-refine流水线,首先生成初始图像集合,然后将其合成为360度全景图。该全景图随后被提升到3D以形成初始点云。我们随后使用多种方法从不同视角生成与初始点云一致的额外图像,并扩展/细化初始点云。给定最终图像集合,我们利用3D Gaussian Splatting创建最终3D场景,可从不同视角进行渲染。实验表明,PanoDreamer在生成高质量、几何一致的3D场景方面有效。

关键词

引用

@article{arxiv.2504.05152,
  title  = {PanoDreamer: Consistent Text to 360-Degree Scene Generation},
  author = {Zhexiao Xiong and Zhang Chen and Zhong Li and Yi Xu and Nathan Jacobs},
  journal= {arXiv preprint arXiv:2504.05152},
  year   = {2025}
}

备注

Accepted by CVPR 2025 Workshop on Computer Vision for Metaverse