中文

LHRS-Bot-Nova:面向遥感视觉语言解释的改进型多模态大语言模型

计算机视觉与模式识别 2024-11-15 v1

摘要

自动且快速地理解地表环境是我们掌握生存环境和进行明智决策的基础。这凸显了需要一个具备分析地表全面能力的统一系统,以满足人类的广泛需求。多模态大语言模型(MLLMs)的出现,在提升智能对地观测的效率和便利性方面具有巨大潜力。这些模型能够进行类人对话,作为理解图像的统一平台,遵循多样化指令,并提供富有洞察力的反馈。在本研究中,我们介绍了 LHRS-Bot-Nova,一种专用于理解遥感(RS)图像的 MLLM,旨在根据人类指令熟练执行广泛的遥感理解任务。LHRS-Bot-Nova 具有增强的视觉编码器和新颖的桥接层,能够实现高效的视觉压缩和更好的语言-视觉对齐。为了进一步增强面向遥感的视觉-语言对齐,我们提出了一个大规模遥感图像-字幕数据集,该数据集通过特征引导的图像重写生成。此外,我们引入了一个专门设计用于提高空间识别能力的指令数据集。大量实验证明了 LHRS-Bot-Nova 在各种遥感图像理解任务中的优越性能。我们还使用一个复杂的多项选择题评估基准,评估了不同 MLLM 在复杂遥感感知和指令遵循方面的表现,为未来的模型选择和改进提供了可靠指南。数据、代码和模型将在 https://github.com/NJU-LHRS/LHRS-Bot 上提供。

关键词

引用

@article{arxiv.2411.09301,
  title  = {LHRS-Bot-Nova: Improved Multimodal Large Language Model for Remote Sensing Vision-Language Interpretation},
  author = {Zhenshi Li and Dilxat Muhtar and Feng Gu and Xueliang Zhang and Pengfeng Xiao and Guangjun He and Xiaoxiang Zhu},
  journal= {arXiv preprint arXiv:2411.09301},
  year   = {2024}
}