中文

GeoChat:面向遥感的地基大型视觉-语言模型

计算机视觉与模式识别 2023-11-28 v1 人工智能

摘要

大型视觉-语言模型(VLM)近期的进展在自然图像领域展现出巨大潜力,使用户能够围绕给定视觉内容进行对话。然而,此类通用领域 VLM 在遥感(RS)场景下表现不佳,在面对 RS 领域特定查询时会产生不准确或虚构的信息。这种行为源于 RS 影像带来的独特挑战。例如,为处理高分辨率 RS 影像中跨类别的多样尺度变化与众多小目标,除整体场景理解外,区域级推理必不可少。此外,缺乏领域特定的多模态指令跟随数据以及适用于 RS 的强骨干模型,使得模型难以将其行为与用户查询对齐。为应对这些局限,我们提出 GeoChat——首个提供高分辨率 RS 图像多任务对话能力的通用遥感 VLM。具体而言,GeoChat 不仅能回答图像级查询,还可接受区域输入以开展区域特定对话。此外,它可通过引用空间坐标在其回答中视觉定位目标。为解决缺乏领域特定数据集的问题,我们通过扩展现有多样 RS 数据集中的图像-文本对,生成了一个新颖的 RS 多模态指令跟随数据集。我们建立了 RS 多任务对话的综合基准,并与若干基线方法比较。GeoChat 在多种 RS 任务上展现出鲁棒的零样本性能,例如图像与区域描述、视觉问答、场景分类、视觉接地对话和指代检测。我们的代码见 https://github.com/mbzuai-oryx/geochat。

关键词

引用

@article{arxiv.2311.15826,
  title  = {GeoChat: Grounded Large Vision-Language Model for Remote Sensing},
  author = {Kartik Kuckreja and Muhammad Sohail Danish and Muzammal Naseer and Abhijit Das and Salman Khan and Fahad Shahbaz Khan},
  journal= {arXiv preprint arXiv:2311.15826},
  year   = {2023}
}

备注

10 pages, 4 figures