中文

面向遥感图像分析的通用且诚实的视觉语言模型 VHM

计算机视觉与模式识别 2024-12-20 v4

摘要

本文开发了一个用于遥感图像分析的通用且诚实的视觉语言模型 (VHM)。VHM 基于大规模遥感图像-文本数据集(含丰富内容标题的 VersaD)以及包含事实性和误导性问题的诚实指令数据集 (HnstD) 构建。不同于现有的遥感图像-文本数据集侧重于少数突出对象及其关系,VersaD 提供关于图像属性、对象属性以及整体场景的详细信息。这种全面标注使 VHM 能够全面理解遥感图像并执行多样化的遥感任务。此外,与现有的遥感指令数据集仅包含事实性问题不同,HnstD 包含源于对象不存在而产生的误导性问题。这一特征防止 VHM 对无意义查询生成肯定答案,从而确保其诚实性。在实验中,VHM 在场景分类、视觉问答和视觉定位等常见任务上显著优于各种视觉语言模型。此外,VHM 在一些尚未探索的任务上也表现出色,如建筑物矢量化、多标签分类和诚实问答。我们将在 https://github.com/opendatalab/VHM 上发布代码、数据和模型权重。

关键词

引用

@article{arxiv.2403.20213,
  title  = {VHM: Versatile and Honest Vision Language Model for Remote Sensing Image Analysis},
  author = {Chao Pang and Xingxing Weng and Jiang Wu and Jiayu Li and Yi Liu and Jiaxing Sun and Weijia Li and Shuai Wang and Litong Feng and Gui-Song Xia and Conghui He},
  journal= {arXiv preprint arXiv:2403.20213},
  year   = {2024}
}

备注

Equal contribution: Chao Pang, Xingxing Weng, Jiang Wu; Corresponding author: Gui-Song Xia, Conghui He