FastScene:基于全景高斯溅射的文本驱动快速 3D 室内场景生成
计算机视觉与模式识别
2024-05-10 v1
摘要
文本驱动的 3D 室内场景生成具有广泛的应用,涵盖游戏、智能家居到 AR/VR 应用。快速且高保真的场景生成对于确保用户友好体验至关重要。然而,现有方法的生成过程冗长,或需要繁琐的手动指定运动参数,给用户带来了不便。此外,这些方法通常依赖窄视场视角的迭代生成,损害了全局一致性和整体场景质量。为了解决这些问题,我们提出了 FastScene,一个在保持场景一致性的同时,实现快速且更高质量 3D 场景生成的框架。具体而言,给定文本提示,我们生成全景图并估计其深度,因为全景图包含整个场景的信息并表现出明确的几何约束。为了获得高质量的新视角,我们引入了粗视角合成(CVS)和渐进式新视角修复(PNVI)策略,以确保场景一致性和视角质量。随后,我们利用多视角投影(MVP)形成透视视角,并应用 3D Gaussian Splatting(3DGS)进行场景重建。综合实验表明,FastScene 在生成速度、质量和更好的场景一致性方面均优于其他方法。值得注意的是,仅由文本提示引导,FastScene 能在短短 15 分钟内生成 3D 场景,比现有最先进的方法快至少一个小时,使其成为用户友好场景生成的典范。
引用
@article{arxiv.2405.05768,
title = {FastScene: Text-Driven Fast 3D Indoor Scene Generation via Panoramic Gaussian Splatting},
author = {Yikun Ma and Dandan Zhan and Zhi Jin},
journal= {arXiv preprint arXiv:2405.05768},
year = {2024}
}
备注
Accepted by IJCAI-2024