GAIA:面向遥感图像分析的全球、多模态、多尺度视觉语言数据集
计算机视觉与模式识别
2026-01-22 v2
摘要
现有的视觉语言模型 (VLM) 主要在网络爬取的噪声图像文本数据上进行训练,对遥感 (RS) 领域的专业化应用暴露有限。这一缺失导致在 RS 特定任务上的表现不佳,因为常用数据集缺乏详细且科学准确的文本描述,仅侧重于日期和位置等属性。为弥合这一关键差距,我们引入了 GAIA,一个专为多尺度、多传感器和多模态 RS 图像分析设计的新型数据集。GAIA 包含 201,005 组精心策划的 RS 图像文本对,代表了不同空间分辨率相关的多样化 RS 模态。与现有的 RS 领域视觉语言数据集不同,GAIA 特别聚焦于捕捉多样化的 RS 应用,提供关于环境变化、自然灾害及其他动态现象的独特信息。该数据集提供了在空间和时间上的平衡分布,覆盖全球范围,涵盖过去 25 年,呈现观察的平衡时间分布。GAIA 的构建采用两个阶段过程: (1) 从权威 RS 相关来源 Targeted web-scraping 图像及其伴随文本, (2) 使用精心设计的提示词利用 GPT-4o 的高级视觉语言能力为每张图像生成五个高质量、科学依据的合成标题。我们的广泛实验,包括对 CLIP 和 BLIP2 模型的微调,表明 GAIA 在 RS 图像分类、跨模态检索和图像标题生成任务方面显著提升了性能。我们将该数据集、自动化处理框架和微调后的模型权重公开于项目 GitHub 仓库:https://github.com/Orion-AI-Lab/GAIA。
引用
@article{arxiv.2502.09598,
title = {GAIA: A Global, Multi-modal, Multi-scale Vision-Language Dataset for Remote Sensing Image Analysis},
author = {Angelos Zavras and Dimitrios Michail and Xiao Xiang Zhu and Begüm Demir and Ioannis Papoutsis},
journal= {arXiv preprint arXiv:2502.09598},
year = {2026}
}
备注
26 pages, 14 figures