中文

从几何仿造到全面生成:面向城市形态合成的上下文感知多模态扩散模型

计算机视觉与模式识别 2026-03-19 v3 人工智能

摘要

城市形态是决定城市功能与活力的关键因素。然而,现有的仿真方法往往将形态生成简化为几何问题,缺乏对城市语义与地理背景的深入理解。为此,本研究提出ControlCity模型,通过多模态信息融合实现城市形态的全面生成。我们首先构建了一个由四元组数据构成的数据集,包含来自全球 22 个城市的“图像-文本-元数据-建筑基准面”。ControlCity 将这些多维信息作为联合控制条件输入,其中增强版 ControlNet 架构编码来自图像的空间约束,而文本与元数据则分别提供语义指导与地理先验,共同引导生成过程。实验结果表明,与单模态基线方法相比,本方法在形态保真度上显著优越,视觉误差(FID)降低 71.01%,达到 50.94,空间重叠度(MIoU)提升 38.46%,达到 0.36。此外,模型展现出强大的知识泛化与可控性,能够实现跨城市风格迁移和对未知城市的零样本生成。消融实验进一步揭示了图像、文本与元数据在生成过程中的独特作用。本研究确认,多模态融合是实现从“几何仿造”到“基于理解的全面生成”的关键路径,为城市形态研究及其应用提供了新范式。

关键词

引用

@article{arxiv.2409.17049,
  title  = {From Geometric Mimicry to Comprehensive Generation: A Context-Informed Multimodal Diffusion Model for Urban Morphology Synthesis},
  author = {Fangshuo Zhou and Huaxia Li and Liuchang Xu and Rui Hu and Sensen Wu and Liang Xu and Hailin Feng and Zhenhong Du},
  journal= {arXiv preprint arXiv:2409.17049},
  year   = {2026}
}

备注

Accepted