中文

MagicDrive3D:面向街景任意视图渲染的可控3D生成

计算机视觉与模式识别 2025-07-28 v4 人工智能

摘要

可控的图像和视频生成模型取得了显著进展,但3D场景生成,尤其是无界场景如自动驾驶领域,仍不成熟。现有方法缺乏灵活的可控性,常依赖受控环境中的密集视图数据收集,限制了其在常见数据集(如nuScenes)上的通用性。本文引入MagicDrive3D,一种用于可控3D街道场景生成的新框架,结合视频基视图合成与3D表示(3DGS)生成。支持多条件控制,包括道路地图、3D物体和文本描述。不同于以往需要在训练前获取3D表示的方法,MagicDrive3D首先训练多视角视频生成模型以综合多样化街道视图。该方法利用常规收集的自动驾驶数据,降低数据获取难度,丰富了3D场景生成。在3DGS生成步骤中,我们引入容错高斯溶解技术以处理轻微错误,并使用单目深度图获得更好的初始化,同时进行外观建模以管理不同视角间的曝光差异。实验表明,MagicDrive3D生成多样化、高质量的3D驾驶场景,支持任意视图渲染,并提升下游任务如BEV分割的性能,展现了其在自动驾驶仿真及更广泛应用中的潜力。

关键词

引用

@article{arxiv.2405.14475,
  title  = {MagicDrive3D: Controllable 3D Generation for Any-View Rendering in Street Scenes},
  author = {Ruiyuan Gao and Kai Chen and Zhihao Li and Lanqing Hong and Zhenguo Li and Qiang Xu},
  journal= {arXiv preprint arXiv:2405.14475},
  year   = {2025}
}

备注

Project Page: https://flymin.github.io/magicdrive3d