中文

SkyNative:面向遥感视觉证据推理的原生多模态框架

计算机视觉与模式识别 2026-05-19 v1

摘要

遥感视觉-语言模型通常依赖预训练的视觉编码器将图像转换为语义特征,再进行语言模型推理。虽然此方法对场景级理解有效,但可能会在压缩局部视觉证据时过早引入,使得在超高分辨率遥感图像中进行细粒度空间推理容易受到语言先验的影响。我们提出 SkyNative,一种面向遥感的原生多模态框架,采用无编码器架构,移除预训练视觉主干,直接将图像表示为语言模型 token 空间中的原始 patch token。为解决低层视觉 patch 与文本 token 之间的差异,SkyNative 引入一种模态感知解耦机制,在统一的自回归主干中使用模态特定参数。我们进一步引入一个视觉依赖基准测试,通过逐步视觉退化和误导性文本提示来诊断模型是否基于图像证据作答。 在标准遥感理解任务和大格式空间推理评估中,SkyNative 显示出更强的图像 grounding perception 以及对 prompt 引发的语言先验更好的鲁棒性。这些结果表明,原生 patch 级多模态建模是可靠遥感视觉-语言推理的有前景的方向。

关键词

引用

@article{arxiv.2605.17949,
  title  = {SkyNative: A Native Multimodal Framework for Remote Sensing Visual Evidence Reasoning},
  author = {Xiao Yang and Ronghao Fu and Zhiwen Lin and Zhuoran Duan and Jiashun Zhu and Jiasen Hu and Lang Sun and Weipeng Zhang and Jiaqi Liu and Xu Na and Haoran Liu and Weijie Zhang and Bo Yang},
  journal= {arXiv preprint arXiv:2605.17949},
  year   = {2026}
}