中文

X-Scene: 大规模高保真且灵活可控的驾驶场景生成

计算机视觉与模式识别 2025-12-09 v3

摘要

扩散模型正在通过实现逼真的数据合成、预测性端到端规划和闭环模拟来推动自动驾驶的发展,其主要关注点是时间一致的生成。然而,需要空间连贯性的大规模3D场景生成仍然探索不足。在本文中,我们提出了X-Scene,一个用于大规模驾驶场景生成的新型框架,实现了几何复杂性、外观保真度和灵活可控性。具体而言,X-Scene支持多粒度控制,包括由用户输入或文本驱动的低层级布局条件化,用于详细的场景组合,以及由用户意图和LLM增强提示引导的高层级语义指导,用于高效定制。为了增强几何和视觉保真度,我们引入了一个统一管道,依次生成3D语义占用和对应的多视角图像与视频,确保跨模态的对齐和时间一致性。我们进一步通过一致性感知的外推将局部区域扩展为大规模场景,从先前生成的区域中外推占用和图像以保持空间和视觉一致性。生成的场景被提升为高质量的3DGS表示,支持模拟和场景探索等多样化应用。广泛的实验表明,X-Scene显著提升了大规模场景生成中的可控性和保真度,为自动驾驶的数据生成和模拟提供了支撑。

关键词

引用

@article{arxiv.2506.13558,
  title  = {X-Scene: Large-Scale Driving Scene Generation with High Fidelity and Flexible Controllability},
  author = {Yu Yang and Alan Liang and Jianbiao Mei and Yukai Ma and Yong Liu and Gim Hee Lee},
  journal= {arXiv preprint arXiv:2506.13558},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025, Project page at https://x-scene.github.io/