中文

想象一座城市:面向程序化3D城市生成的CityGenAgent

计算机视觉与模式识别 2026-03-02 v2

摘要

交互式3D城市的自动生成是一项关键挑战,具有广泛的应用前景,包括自动驾驶、虚拟现实和具身智能。尽管近期生成模型和程序化技术的进展提高了城市生成的真实感,但现有方法往往在高保真资产创建、可控性和操控性方面存在困难。本文引入CityGenAgent,一个自然语言驱动的分层程序化3D城市生成框架。我们的方法将城市生成分解为两个可解释的组成部分:区块程序和建筑程序。为确保结构正确性和语义对齐,我们采用两阶段学习策略:(1)监督微调(SFT)。我们训练BlockGen和BuildingGen以生成符合模式约束的有效程序,包括非自相交多边形和完整字段;(2)强化学习(RL)。我们设计空间对齐奖励以增强空间推理能力,设计视觉一致性奖励以弥补文本描述与视觉模态之间的差距。由于程序及模型的泛化能力,CityGenAgent支持自然语言编辑和操控。全面评估表明,与现有方法相比,CityGenAgent在语义对齐、视觉质量和可控性方面均表现出优势,为可扩展的3D城市生成奠定了稳健基础。

关键词

引用

@article{arxiv.2602.05362,
  title  = {Imagine a City: CityGenAgent for Procedural 3D City Generation},
  author = {Zishan Liu and Zecong Tang and RuoCheng Wu and Xinzhe Zheng and Jingyu Hu and Ka-Hei Hui and Haoran Xie and Bo Dai and Zhengzhe Liu},
  journal= {arXiv preprint arXiv:2602.05362},
  year   = {2026}
}