中文

RingMo-Agent:面向多平台多模态遥感的统一远程感知基础模型

计算机视觉与模式识别 2026-01-06 v2

摘要

来自多个模态和平台的遥感图像因传感器特性和成像视角的差异而呈现出多样化的细节。现有的遥感领域视觉语言研究主要依赖相对均匀的数据源。此外,这些方法仍主要局限于分类或描述等传统视觉感知任务。结果是,这些方法无法作为能够有效处理来自不同来源的遥感图像的统一且独立的框架。为此,我们提出RingMo-Agent,一个能够处理多模态和多平台数据,并根据用户文本指令执行感知和推理任务的模型。与现有模型相比,RingMo-Agent 1)由大规模视觉语言数据集RS-VL3M支持,包含超过300万张图像-文本对,涵盖光学、合成孔径雷达和红外模态,来自卫星和无人机平台,覆盖感知和挑战性推理任务;2)通过引入分离的嵌入层来学习模态自适应表示,构建隔离的异构模态特征,减少跨模态干扰;3)通过引入任务特定标记,并采用针对长程空间任务设计的基于标记的高维隐藏状态解码机制来统一任务建模。广泛的实验表明,RingMo-Agent不仅在视觉理解和复杂分析任务中都表现有效,而且在不同平台和感知模态之间展现出强大的通用性。

关键词

引用

@article{arxiv.2507.20776,
  title  = {RingMo-Agent: A Unified Remote Sensing Foundation Model for Multi-Platform and Multi-Modal Reasoning},
  author = {Huiyang Hu and Peijin Wang and Yingchao Feng and Kaiwen Wei and Wenxin Yin and Wenhui Diao and Mengyu Wang and Hanbo Bi and Kaiyue Kang and Tong Ling and Kun Fu and Xian Sun},
  journal= {arXiv preprint arXiv:2507.20776},
  year   = {2026}
}

备注

23 pages, 6 figures, 20 tables