MGIMM:面向属性引导的遥感图像详细描述的多粒度指令多模态模型
计算机视觉与模式识别
2024-06-10 v1
摘要
近年来,大型多模态模型在视觉到文本信息之间建立了桥梁,但在遥感场景中往往表现不佳。这种欠佳表现是由于遥感图像中目标分布复杂且目标间尺度差异显著,导致这些多模态模型出现视觉模糊和描述不足。此外,缺乏针对遥感领域的多模态微调数据使得模型行为难以与用户查询对齐。为解决这些问题,本文提出了一种属性引导的**多粒度指令多模态模型(MGIMM)**,用于遥感图像的详细描述。MGIMM通过区域级指令微调,引导多模态模型学习视觉区域与相应文本属性(如目标名称、颜色和形状)之间的一致性。然后,在区域-属性对齐的多模态模型基础上,MGIMM在多粒度视觉特征的引导下,充分感知区域级和全局图像信息,利用大语言模型对遥感图像进行全面描述。由于缺乏用于遥感图像详细描述生成的标准基准,我们构建了一个包含38,320个区域-属性对和23,463个图像-详细描述对的数据集。在该数据集上与各种先进方法进行比较,结果证明了MGIMM区域-属性引导学习方法的有效性。代码可在https://github.com/yangcong356/MGIMM.git获取。
引用
@article{arxiv.2406.04716,
title = {MGIMM: Multi-Granularity Instruction Multimodal Model for Attribute-Guided Remote Sensing Image Detailed Description},
author = {Cong Yang and Zuchao Li and Lefei Zhang},
journal= {arXiv preprint arXiv:2406.04716},
year = {2024}
}