遥感检索增强生成:通过多模态数据集与检索增强生成模型连接遥感影像与综合知识
计算机视觉与模式识别
2026-02-13 v2 人工智能
摘要
VLMs 的最新进展展示了其在自然图像领域各种任务上的出色能力。受这些进展启发,遥感界已开始采用 VLMs 执行遥感视觉-语言任务,包括场景理解、图像描述和视觉问答。然而,现有的遥感 VLMs 通常依赖于闭集场景理解并侧重于通用场景描述,缺乏结合外部知识的能力。这一局限性阻碍了它们对涉及领域特定知识或世界知识的复杂或上下文相关查询进行语义推理的能力。为了应对这些挑战,我们首先引入了一个多模态遥感世界知识(RSWK)数据集,该数据集包含来自 175 个国家的 14,141 个著名地标的高分辨率卫星影像和详细文本描述,融合了遥感领域知识和更广泛的世界知识。在此数据集的基础上,我们提出了一种新颖的遥感检索增强生成(RS-RAG)框架,该框架由两个关键组件组成。多模态知识向量数据库构建模块将遥感影像和相关文本知识编码到统一的向量空间中。知识检索与响应生成模块根据图像和/或文本查询检索并重新排序相关知识,并将检索到的内容纳入知识增强的提示中,以指导 VLM 生成有上下文依据的响应。我们在三个具有代表性的视觉-语言任务上验证了我们方法的有效性,包括图像描述、图像分类和视觉问答,其中 RS-RAG 显著优于最先进的基线方法。
引用
@article{arxiv.2504.04988,
title = {Remote Sensing Retrieval-Augmented Generation: Bridging Remote Sensing Imagery and Comprehensive Knowledge with a Multi-Modal Dataset and Retrieval-Augmented Generation Model},
author = {Congcong Wen and Yiting Lin and Xiaokang Qu and Nan Li and Yong Liao and Xiang Li and Hui Lin},
journal= {arXiv preprint arXiv:2504.04988},
year = {2026}
}
备注
Accepted by IEEE Geoscience and Remote Sensing Magazine (GRSM)