Scene4U:从单张全景图像构建分层3D场景重建,支持沉浸式探索
计算机视觉与模式识别
2025-04-22 v2
摘要
沉浸式真实3D场景的构建具有重要实际意义,广泛应用于计算机视觉和计算机图形学等多个领域。通常,沉浸式真实场景应避免由动态物体遮挡,保持全局纹理一致性,并支持无限制的探索。当前基于图像驱动的场景构建方法通常通过移动虚拟相机反复细化初始图像来生成场景。然而,先前方法在不同相机姿态下因全局纹理不一致性而出现视觉离散,常因前景-背景遮挡导致场景出现空洞。为此,我们提出一种新颖的从全景图像构建分层3D场景重建框架,命名为Scene4U。具体而言,Scene4U 将开放词汇分割模型与大型语言模型集成,以将真实全景图像分解为多个层次。随后,我们基于扩散模型的分层修复模块利用视觉线索和深度信息恢复被遮挡区域,生成场景的分层表示。多层全景随后被初始化为3D Gaussian Splatting 表示,随后进行分层优化,最终生成具有语义和结构一致性的沉浸式3D场景,支持自由探索。Scene4U 在最先进方法上实现了LPIPS提升24.24%和BRISQUE提升24.40%,同时实现了最快的训练速度。此外,为演示Scene4U的鲁棒性并让用户能够从各类著名景点体验沉浸式场景,我们构建了WorldVista3D数据集进行3D场景重建,包含全球著名景点的全景图像。实现代码和数据集将在 https://github.com/LongHZ140516/Scene4U 公开。
关键词
引用
@article{arxiv.2504.00387,
title = {Scene4U: Hierarchical Layered 3D Scene Reconstruction from Single Panoramic Image for Your Immerse Exploration},
author = {Zilong Huang and Jun He and Junyan Ye and Lihan Jiang and Weijia Li and Yiping Chen and Ting Han},
journal= {arXiv preprint arXiv:2504.00387},
year = {2025}
}
备注
CVPR 2025, 11 pages, 7 figures