SEM-ROVER:语义体素引导扩散的大规模驾驶场景生成
计算机视觉与模式识别
2026-04-08 v1
摘要
可扩展的户外驾驶场景生成需要能够在多个视角下保持一致并扩展到大面积的三维表示。现有方案要么依赖蒸馏到三维空间的图像或视频生成模型,这会损害几何一致性并将渲染限制在训练视角,要么仅限于小规模三维场景或面向对象的生成。在这项工作中,我们提出了一种基于 -Voxfield 网格的三维生成框架,这是一种离散表示,其中每个被占据的体素存储固定数量的着色表面样本。为了生成该表示,我们训练了一个语义条件扩散模型,该模型在局部体素邻域上操作并使用三维位置编码来捕捉空间结构。我们通过重叠区域上的渐进空间外绘来扩展到大规模场景。最后,我们使用延迟渲染模块渲染生成的 -Voxfield 网格以获得照片级真实图像,从而实现了无需逐场景优化的大规模多视角一致三维场景生成。大量实验表明,我们的方法能够生成多样化的、大规模的城市户外场景,可使用各种传感器配置和相机轨迹渲染为照片级真实图像,同时与现有方法相比保持适中的计算成本。
引用
@article{arxiv.2604.06113,
title = {SEM-ROVER: Semantic Voxel-Guided Diffusion for Large-Scale Driving Scene Generation},
author = {Hiba Dahmani and Nathan Piasco and Moussab Bennehar and Luis Roldão and Dzmitry Tsishkou and Laurent Caraffa and Jean-Philippe Tarel and Roland Brémond},
journal= {arXiv preprint arXiv:2604.06113},
year = {2026}
}