中文

CoMa:基于视觉语言模型的上下文体量生成

计算机视觉与模式识别 2026-01-14 v1 人工智能

摘要

建筑与城市规划中的概念设计阶段,特别是建筑体量设计,非常复杂且严重依赖设计师的直觉和人工工作。为解决这一问题,我们提出了一种基于功能需求和场地环境自动生成建筑体量的框架。此类数据驱动方法面临的一个主要障碍是缺乏合适的数据集。因此,我们引入了 CoMa-20K 数据集,这是一个综合性的集合,包含详细的体量几何结构、相关的经济和规划数据,以及开发场地在其现有城市环境中的视觉表示。我们通过将体量生成表述为视觉语言模型 (VLMs) 的条件任务来对该数据集进行基准测试,评估了微调模型和大型零样本模型。我们的实验揭示了该任务固有的复杂性,同时展示了 VLMs 生成对环境敏感的体量方案的潜力。该数据集和分析确立了基础基准,并突显了数据驱动建筑设计未来研究的重大机遇。

关键词

引用

@article{arxiv.2601.08464,
  title  = {CoMa: Contextual Massing Generation with Vision-Language Models},
  author = {Evgenii Maslov and Valentin Khrulkov and Anastasia Volkova and Anton Gusarov and Andrey Kuznetsov and Ivan Oseledets},
  journal= {arXiv preprint arXiv:2601.08464},
  year   = {2026}
}

备注

Code and dataset will be released later