LSD-3D:具有几何基础的大规模三维驾驶场景生成
计算机视觉与模式识别
2025-08-27 v1 人工智能
图形学
摘要
大规模场景数据对于机器人学习中的训练和测试至关重要。神经重建方法承诺能够从捕获的传感器数据中重建大型物理真实户外场景。然而,这些方法内嵌了静态环境,且仅允许有限的场景控制——它们在场景和轨迹多样性上受到重建所依据的捕获数据的功能性限制。相比之下,使用最新的图像或视频扩散模型生成驾驶数据提供了控制能力,但代价是牺牲了几何基础和因果性。在这项工作中,我们旨在弥合这一差距,并提出一种直接生成具有精确几何的大规模三维驾驶场景的方法,允许进行具有物体持久性和显式三维几何估计的因果新视角合成。所提出的方法将代理几何与环境表示的生成与从学习的二维图像先验中进行的得分蒸馏相结合。我们发现,这种方法允许高可控性,能够实现基于提示引导的几何以及可基于地图布局进行条件控制的高保真纹理和结构——从而生成逼真且几何一致的复杂驾驶场景三维生成结果。
引用
@article{arxiv.2508.19204,
title = {LSD-3D: Large-Scale 3D Driving Scene Generation with Geometry Grounding},
author = {Julian Ost and Andrea Ramazzina and Amogh Joshi and Maximilian Bömer and Mario Bijelic and Felix Heide},
journal= {arXiv preprint arXiv:2508.19204},
year = {2025}
}
备注
Project webpage: https://light.princeton.edu/LSD-3D