Text2Earth:利用全球尺度数据集与基础模型解锁文本驱动的遥感图像生成
计算机视觉与模式识别
2025-03-21 v2
摘要
生成式基础模型推动了大规模文本驱动的自然图像生成,成为各个垂直领域的重要研究趋势。然而,在遥感领域,仍然缺乏关于大规模文本到图像(text2image)生成技术的研究。现有的遥感图像-文本数据集规模较小,且局限于特定的地理区域和场景类型。此外,现有的 text2image 方法难以实现全球尺度、多分辨率可控且无界图像生成。为了应对这些挑战,本文提出了两项关键贡献:Git-10M 数据集和 Text2Earth 基础模型。Git-10M 是一个全球尺度的图像-文本数据集,包含 1050 万个图像-文本对,比此前最大的数据集大 5 倍。该数据集涵盖了广泛的地理场景并包含分辨率信息,在规模和多样性上均显著超越现有数据集。基于 Git-10M,我们提出了 Text2Earth,一个基于扩散框架的 13 亿参数生成式基础模型,用于建模全球尺度的遥感场景。Text2Earth 集成了分辨率引导机制,使用户能够指定图像分辨率。提出了一种用于训练和推理的动态条件适应策略以提高图像质量。Text2Earth 在零样本 text2image 生成方面表现出色,并在包括无界场景构建、图像编辑和跨模态图像生成在内的多个任务中展现出强大的泛化能力和灵活性。这种强大的能力超越了以前局限于基本固定大小和有限场景类型的模型。在先前的基准数据集上,Text2Earth 优于先前的模型,FID 提升了 +26.23,Zero-shot Cls-OA 指标提升了 +20.95%。我们的项目页面是 https://chen-yang-liu.github.io/Text2Earth
引用
@article{arxiv.2501.00895,
title = {Text2Earth: Unlocking Text-driven Remote Sensing Image Generation with a Global-Scale Dataset and a Foundation Model},
author = {Chenyang Liu and Keyan Chen and Rui Zhao and Zhengxia Zou and Zhenwei Shi},
journal= {arXiv preprint arXiv:2501.00895},
year = {2025}
}