合成住宅:面向数据稀缺下住宅建筑数据生成的多模态生成式 AI 流水线
人工智能
2026-04-09 v4 机器学习
摘要
计算模型已成为建筑和城市尺度多尺度能源建模研究的强大工具,支持跨建筑和城市能源系统的数据驱动分析。然而,这些模型需要大量建筑参数数据,而这些数据通常难以获取、收集成本高昂或受隐私限制。我们引入了一个模块化、多模态的生成式人工智能(AI)框架,该框架集成了图像、表格和基于仿真的组件,并从公开可用的县级记录和图像生成合成住宅建筑数据集,同时提出了一个实例化该框架的端到端流水线。为了减少典型的大语言模型(LLM)挑战,我们使用基于遮挡的视觉焦点分析来评估模型组件。我们的分析表明,在建筑图像处理方面,我们选择的视觉-语言模型比基于 GPT 的替代方案实现了显著更强的视觉焦点。我们还在国家参考数据集上评估了结果的真实性。在所有评估参数中,我们的合成数据与参考数据集的重合度超过 65%,其中四个参数中有三个超过 90%。这项工作减少了对昂贵或受限数据源的依赖,降低了建筑级能源研究和机器学习(ML)驱动的城市能源建模的门槛,从而能够在数据稀缺的情况下实现可扩展的下游任务,如能源建模、改造分析和城市级仿真。
引用
@article{arxiv.2509.09794,
title = {Synthetic Homes: A Multimodal Generative AI Pipeline for Residential Building Data Generation under Data Scarcity},
author = {Jackson Eshbaugh and Chetan Tiwari and Jorge Silveyra},
journal= {arXiv preprint arXiv:2509.09794},
year = {2026}
}
备注
33 pages; 2 appendices; 6 figures; 2 tables. Code available at https://github.com/Lafayette-EshbaughSilveyra-Group/synthetic-homes