基于OSM的遥感VLMs领域适应方法
计算机视觉与模式识别
2026-03-26 v2 机器学习
摘要
遥感视觉语言模型(VLMs)依赖于领域特定的图像-文本监督,但卫星和航空图像的高质量标注稀缺且昂贵。现有的伪标签管道通过从大型前沿模型蒸馏知识来弥补这一差距,但这种对大型教师模型的依赖成本高昂、限制了可扩展性,并将可达性能限制在教师模型的性能上。我们提出了OSMDA:一个自包含的领域适应框架,消除了这种依赖。我们的关键洞察是,一个有能力的基础VLMs可以作为自身的标注引擎:通过将航空图像与渲染的OpenStreetMap(OSM)瓦片配对,我们利用模型的光学字符识别和图表理解能力生成富含OSM广泛辅助元数据的标题。随后,该模型在仅使用卫星图像的语料库上进行微调,生成OSMDA-VLM——一个无需手动标注、无需更强外部模型即可实现领域适应的VLMs。我们在覆盖10个基准的数据集上进行了详尽评估,比较了9个有竞争力的基线方法。在与真实数据等比例混合时,我们的方法实现了最先进的结果,而且比依赖教师模型的方案在训练成本上显著更低。这些结果表明,给定一个强大的基础模型,与众所周知的地理数据的对齐是实现遥感领域适应的实用且可扩展的路径。数据集和模型权重将公开发布。
引用
@article{arxiv.2603.11804,
title = {OSMDA: OpenStreetMap-based Domain Adaptation for Remote Sensing VLMs},
author = {Stefan Maria Ailuro and Mario Markov and Mohammad Mahdi and Delyan Boychev and Luc Van Gool and Danda Pani Paudel},
journal= {arXiv preprint arXiv:2603.11804},
year = {2026}
}