SkyEyeGPT:通过大语言模型指令微调统一遥感视觉 - 语言任务
计算机视觉与模式识别
2024-01-19 v1
摘要
大语言模型 (LLMs) 最近已扩展至视觉 - 语言领域,获得了令人印象深刻的通用多模态能力。然而,针对遥感 (RS) 数据的多模态大语言模型 (MLLMs) 探索仍处于起步阶段,且性能尚不理想。在本工作中,我们介绍了 SkyEyeGPT,这是一种专为 RS 视觉 - 语言理解设计的统一多模态大语言模型。为此,我们精心构建了一个 RS 多模态指令微调数据集,包括单任务和多任务对话指令。经过人工验证,我们获得了一个包含 968k 样本的高质量 RS 指令跟随数据集。我们的研究表明,通过简单而有效的设计,SkyEyeGPT 在截然不同的任务上表现惊人地好,无需额外的编码模块。具体而言,在通过对齐层将 RS 视觉特征投影到语言域后,将它们与特定任务指令一起输入基于 LLM 的 RS 解码器,以预测 RS 开放式任务的答案。此外,我们设计了一种两阶段微调方法,以在不同粒度上增强指令跟随和多轮对话能力。在 8 个 RS 视觉 - 语言任务数据集上的实验表明,SkyEyeGPT 在图像级和区域级任务(如图像描述和视觉定位)中表现出优越性。特别是,在一些定性测试中,SkyEyeGPT 展现出与 GPT-4V 相比令人鼓舞的结果。在线演示、代码和数据集将在 https://github.com/ZhanYang-nwpu/SkyEyeGPT 发布。
引用
@article{arxiv.2401.09712,
title = {SkyEyeGPT: Unifying Remote Sensing Vision-Language Tasks via Instruction Tuning with Large Language Model},
author = {Yang Zhan and Zhitong Xiong and Yuan Yuan},
journal= {arXiv preprint arXiv:2401.09712},
year = {2024}
}