WonderWorld: 从单张图像交互式生成3D场景
计算机视觉与模式识别
2025-03-26 v4 图形学
摘要
我们提出了WonderWorld,一个新颖的交互式3D场景生成框架,使用户能够交互式地指定场景内容和布局,并以低延迟看到创建的场景。主要挑战在于实现3D场景的快速生成。现有的场景生成方法速度不足,因为它们通常需要(1)逐步生成多个视图和深度图,以及(2)耗时的场景几何表示优化。我们引入了快速分层高斯曲面元作为我们的场景表示,以及从单视图生成它的算法。我们的方法不需要多个视图,并且利用基于几何的初始化,显著减少了优化时间。另一个挑战是生成连贯的几何结构,使得所有场景能够连接。我们引入了引导深度扩散,允许对深度估计进行部分条件约束。WonderWorld在单个A6000 GPU上不到10秒内生成连接且多样化的3D场景,支持实时用户交互和探索。我们展示了WonderWorld在虚拟环境中进行用户驱动内容创建和探索的潜力。我们发布了用于复现的完整代码和软件。项目网站:https://kovenyu.com/WonderWorld/。
引用
@article{arxiv.2406.09394,
title = {WonderWorld: Interactive 3D Scene Generation from a Single Image},
author = {Hong-Xing Yu and Haoyi Duan and Charles Herrmann and William T. Freeman and Jiajun Wu},
journal= {arXiv preprint arXiv:2406.09394},
year = {2025}
}
备注
CVPR 2025. Project website: https://kovenyu.com/WonderWorld/. The first two authors contributed equally