中文

EarthMarker:基于视觉提示的遥感多模态大语言模型

计算机视觉与模式识别 2024-12-02 v3

摘要

近期的提示学习技术进展使得用户能够通过多轮对话与人工智能工具进行交互,实现对图像的交互式理解。然而,仅凭纯文本指令难以高效地传递遥感(RS)场景中的复杂信息,这会严重阻碍对图像潜在内容的深入理解。此外,现有的自然场景提示策略难以应用于解释遥感数据,因为其存在显著的领域差异。为此,本文提出首个基于视觉提示的遥感多模态大语言模型(MLLM),命名为EarthMarker。EarthMarker能够通过视觉提示(即框和点)在图像、区域和点三个层面解释遥感图像。具体而言,我们发展了共享的视觉编码方法,以建立输入图像多尺度表示与各种视觉提示之间的空间模式解释关系。随后,将混合的视觉-空间表示与语言指令关联,构建联合提示,从而实现对遥感图像复杂内容的解释。此外,为弥合自然场景与RS数据之间的领域差距,有效地将自然场景中的领域知识迁移至RS领域,我们开发了跨域学习策略以促进遥感图像理解。除此之外,为解决RS视觉提示数据匮乏的问题,本文构建了一个名为RSVP的数据集,包含多模态、多粒度的视觉提示指令跟随数据。我们的代码与数据集已发布于https://github.com/wivizhang/EarthMarker。

关键词

引用

@article{arxiv.2407.13596,
  title  = {EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing},
  author = {Wei Zhang and Miaoxin Cai and Tong Zhang and Jun Li and Yin Zhuang and Xuerui Mao},
  journal= {arXiv preprint arXiv:2407.13596},
  year   = {2024}
}