GeoSynth:上下文感知的高分辨率卫星图像合成
计算机视觉与模式识别
2024-04-11 v1
摘要
我们提出了 GeoSynth,一个通过全局风格和图像驱动的布局控制来合成卫星图像的模型。全局风格控制通过文本提示或地理位置实现。它们分别能够指定场景语义或区域外观,并且可以结合使用。我们在一个包含配对卫星图像、自动生成的描述文本以及 OpenStreetMap 数据的大型数据集上训练了我们的模型。我们评估了各种控制输入组合,包括不同类型的布局控制。结果表明,我们的模型能够生成多样且高质量的图像,并展现出出色的零样本泛化能力。代码和模型检查点可在 https://github.com/mvrl/GeoSynth 获取。
引用
@article{arxiv.2404.06637,
title = {GeoSynth: Contextually-Aware High-Resolution Satellite Image Synthesis},
author = {Srikumar Sastry and Subash Khanal and Aayush Dhakal and Nathan Jacobs},
journal= {arXiv preprint arXiv:2404.06637},
year = {2024}
}