超越GSD作为令牌:遥感视觉语言模型的连续尺度条件化
计算机视觉与模式识别
2026-05-11 v1
摘要
遥感视觉语言模型(RS-VLMs)面临与自然图像模型之间的根本性不匹配:同一地理对象在地面采样距离(GSD)跨越多个数量级后,呈现出根本不同的视觉证据。然而,现有的RS-VLMs往往忽略GSD或将其作为离散文本标记注入,迫使单一静态参数集合吸收整个尺度谱。我们引入ScaleEarth,一个建立在Qwen3-VL之上的参数高效微调框架,将GSD视为连续条件变量来控制模型的计算路径。其核心为CS-HLoRA(Continuous Scale-Conditioned Hyper-LoRA),通过GSD驱动的门控机制调制LoRA低秩子空间,使模型能够根据物理尺度动态路由计算。为消除在部署时对传感器元数据的依赖,我们将CS-HLoRA与SSE-U(轻量异方差子头)搭配,后者从视觉特征预测GSD及其不确定性。为提供匹配的监督,我们构建GeoScale-VQA,包含150万样本的尺度分层遥感VQA语料,其问答生成同样以驱动CS-HLoRA的物理标量为条件,形成闭合的方法-数据环路。在8B模型上使用QLoRA训练,ScaleEarth在覆盖多种地球系统任务的遥感基准(包括XLRS-Bench和OmniEarth-Bench)上实现了最先进的成绩。
引用
@article{arxiv.2605.07562,
title = {Beyond GSD-as-Token: Continuous Scale Conditioning for Remote Sensing VLMs},
author = {Song Zhang and Yanlong Chen and Yilin Li and Yining Chen and Zili Yi and Xiaowei Zhang and Yawei Li},
journal= {arXiv preprint arXiv:2605.07562},
year = {2026}
}
备注
Under review. 30 pages, 16 figures, 7 tables