中文

通过MLLM和基于LLM的高质量图文数据集生成增强遥感视觉语言模型

计算机视觉与模式识别 2025-07-23 v1

摘要

视觉语言基础模型(VLFMs)在遥感(RS)图像中的应用因其在各种下游任务中的卓越能力而受到广泛关注。一个关键挑战在于缺乏高质量、大规模、图像-文本配对训练数据。最近,一些研究为遥感引入了大规模的图文数据集并训练了它们的VLFMs。然而,由于用于生成描述的方法较为初级,数据集质量欠佳,需要更大规模的训练数据,却只能带来有限的性能提升。在本文中,我们提出了一种名为MpGI(多视角生成与集成)的两阶段方法,用于为遥感图像生成高质量的文本描述。首先,我们使用Rule-MLLM(多模态大语言模型)接力生成和MLLMs生成方法,从不同视角生成独特且详细的描述。接着,我们利用大语言模型(LLMs)将这些多样化的描述集成为全面的描述,从多个视角捕捉细节。最后,我们创建了HQRS-IT-210K数据集,包含约21万张遥感图像和130万条描述。我们使用该数据集微调了两个VLFMs:判别式模型CLIP和图像到文本生成式模型CoCa。这一过程产生了我们提出的HQRS-CLIP和RS-CoCa模型。实验结果表明,HQRS-CLIP在使用仅4.2%训练数据的情况下,在各种下游任务中超越了之前最先进的遥感CLIP模型。RS-CoCa在基准数据集上优于其他先进方法,并且能够为遥感图像生成可与人工标注相媲美甚至更优的描述。数据集、预训练模型和代码将在https://github.com/YiguoHe/HQRS-210K-and-HQRS-CLIP发布。

关键词

引用

@article{arxiv.2507.16716,
  title  = {Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation},
  author = {Yiguo He and Junjie Zhu and Yiying Li and Xiaoyu Zhang and Chunping Qiu and Jun Wang and Qiangjuan Huang and Ke Yang},
  journal= {arXiv preprint arXiv:2507.16716},
  year   = {2025}
}

备注

SUBMIT TO IEEE TRANSACTIONS