MajutsuCity:基于可控 3D 资产与布局的语言驱动审美自适应城市生成
计算机视觉与模式识别
2025-12-09 v2
摘要
生成逼真的 3D 城市是世界模型、虚拟现实和游戏开发的基本任务,理想的城市场景需同时满足风格多样性、精细细节和可控性。然而,现有方法在文本驱动的创意灵活性与基于显式结构表示的对象级可编辑性之间难以平衡。我们提出 MajutsuCity,一个自然语言驱动且审美自适应的框架,用于合成结构一致且风格多样的 3D 城市场景。MajutsuCity 将城市表示为可控布局、资产和材料的组成部分,并通过四阶段管道运行。为扩展生成后的可控性,我们进一步集成了 MajutsuAgent——一个支持五种对象级操作的交互式语言 grounding 编辑代理。为支持照片级真实感和可定制的场景合成,我们还构建了 MajutsuDataset,包含 2D 语义布局和高度图、多样化的 3D 建筑资产,以及精选的 PBR 材料和天空盒,每项都伴随详细注释。我们制定了实用的评估指标体系,涵盖结构一致性、场景复杂度、材料保真度和光照氛围等关键维度。广泛实验表明,与 CityDreamer 相比,MajutsuCity 的布局 FID 降低 83.7%,与 CityCraft 相比降低 20.1%。本方法在所有 AQS 和 RDR 分数上均名列第一,显著优于现有方法。这些结果确认 MajutsuCity 在几何保真度、风格适应性和语义可控性方面达到新的状态量级。我们期望本框架能为 3D 城市生成的新研究路径提供灵感。项目页面:https://longhz140516.github.io/MajutsuCity/。
引用
@article{arxiv.2511.20415,
title = {MajutsuCity: Language-driven Aesthetic-adaptive City Generation with Controllable 3D Assets and Layouts},
author = {Zilong Huang and Jun He and Xiaobin Huang and Ziyi Xiong and Yang Luo and Junyan Ye and Weijia Li and Yiping Chen and Ting Han},
journal= {arXiv preprint arXiv:2511.20415},
year = {2025}
}
备注
13 pages, 6 figures