SCube:使用 VoxSplats 的即时大规模场景重建
计算机视觉与模式识别
2024-10-29 v1 人工智能
图形学
摘要
我们提出了 SCube,一种从稀疏有姿态图像重建大规模 3D 场景(几何、外观和语义)的新方法。我们的方法使用一种新的表示 VoxSplat 对重建场景进行编码,该表示是支撑在高分辨率稀疏体素骨架上的一组 3D 高斯。为了从图像重建 VoxSplat,我们采用了以输入图像为条件的分层体素潜在扩散模型,随后是一个前馈外观预测模型。扩散模型以由粗到细的方式逐步生成高分辨率网格,外观网络在每个体素内预测一组高斯。仅使用少至 3 张非重叠输入图像,SCube 即可在 20 秒内生成数百万个高斯,其体素网格分辨率为 1024^3,跨度达数百米。以往从图像进行场景重建的工作要么依赖逐场景优化,且无法重建远离输入视角的场景(因此需要密集的视角覆盖作为输入),要么利用基于低分辨率模型的几何先验,从而产生模糊的结果。相比之下,SCube 利用高分辨率稀疏网络,并从少视角生成清晰的输出。我们使用 Waymo 自动驾驶数据集在 3D 重建上展示了 SCube 相较于现有技术的优越性,并展示了其应用,如 LiDAR 模拟和文本到场景生成。
引用
@article{arxiv.2410.20030,
title = {SCube: Instant Large-Scale Scene Reconstruction using VoxSplats},
author = {Xuanchi Ren and Yifan Lu and Hanxue Liang and Zhangjie Wu and Huan Ling and Mike Chen and Sanja Fidler and Francis Williams and Jiahui Huang},
journal= {arXiv preprint arXiv:2410.20030},
year = {2024}
}
备注
NeurIPS 2024. Project page: https://research.nvidia.com/labs/toronto-ai/scube/