MMM-RS:面向文本到图像生成的多模态、多地面采样距离、多场景遥感数据集与基准
图像与视频处理
2024-10-31 v1 人工智能
计算机视觉与模式识别
摘要
近年来,基于扩散的生成范式凭借其精确的分布建模和稳定的训练过程,在文本提示下实现了令人印象深刻的通用图像生成能力。然而,由于缺乏包含多种模态、地面采样距离和场景的综合性遥感图像生成数据集,生成与通用图像在尺度和视角上差异巨大的多样化遥感图像仍然是一个艰巨的挑战。在本文中,我们提出了一个面向多样化遥感场景中文本到图像生成的多模态、多地面采样距离、多场景遥感数据集与基准。具体来说,我们首先收集了九个公开可用的遥感数据集,并对所有样本进行了标准化处理。为了将遥感图像与文本语义信息桥接起来,我们利用大规模预训练的视觉-语言模型自动输出文本提示,并进行人工修正,从而得到信息丰富的文本-图像对(包括多模态图像)。特别地,我们设计了一些方法,以在单个样本中获得具有不同地面采样距离和不同环境(例如,低光照、有雾)的图像。经过大量的人工筛选和标注修正,我们最终获得了包含约 210 万文本-图像对的 MMM-RS 数据集。大量实验结果表明,我们提出的 MMM-RS 数据集使得现成的扩散模型能够生成跨不同模态、场景、天气条件和地面采样距离的多样化遥感图像。该数据集可在 https://github.com/ljl5261/MMM-RS 获取。
引用
@article{arxiv.2410.22362,
title = {MMM-RS: A Multi-modal, Multi-GSD, Multi-scene Remote Sensing Dataset and Benchmark for Text-to-Image Generation},
author = {Jialin Luo and Yuanzhi Wang and Ziqi Gu and Yide Qiu and Shuaizhen Yao and Fuyun Wang and Chunyan Xu and Wenhua Zhang and Dan Wang and Zhen Cui},
journal= {arXiv preprint arXiv:2410.22362},
year = {2024}
}
备注
Accepted by NeurIPS 2024