中文

Urban Architect:基于布局先验的可控 3D 城市场景生成

计算机视觉与模式识别 2024-04-11 v1

摘要

借助大规模文本到图像扩散模型,文本到 3D 生成取得了显著成功。然而,目前尚无将该方法扩展至城市规模的范式。城市场景具有元素众多、排列关系复杂和规模庞大的特点,这对模糊文本描述的可解释性以进行有效模型优化构成了巨大障碍。在本工作中,我们通过将组合式 3D 布局表示引入文本到 3D 范式中作为额外先验,克服了这些局限性。它由一组具有简单几何结构和明确排列关系的语义基元组成,补充了文本描述并实现了可控生成。在此基础上,我们提出了两项修改——(1) 我们引入了布局引导的变分分数蒸馏以解决模型优化不足的问题。它利用 3D 布局的几何和语义约束来调节分数蒸馏采样过程。(2) 为了处理城市场景的无界特性,我们使用可扩展哈希网格结构表示 3D 场景,逐步适应城市场景不断增长的规模。大量实验证实了我们的框架首次能够将文本到 3D 生成扩展到覆盖超过 1000m 驾驶距离的大规模城市场景。我们还展示了各种场景编辑示例,展现了可控城市场景生成的强大能力。网站:https://urbanarchitect.github.io。

关键词

引用

@article{arxiv.2404.06780,
  title  = {Urban Architect: Steerable 3D Urban Scene Generation with Layout Prior},
  author = {Fan Lu and Kwan-Yee Lin and Yan Xu and Hongsheng Li and Guang Chen and Changjun Jiang},
  journal= {arXiv preprint arXiv:2404.06780},
  year   = {2024}
}

备注

Project page: https://urbanarchitect.github.io/