合成孔径雷达图像中的语义理解视觉语言基础模型
计算机视觉与模式识别
2026-05-18 v3 人工智能
摘要
合成孔径雷达 (SAR) 因其全天候作业能力而是关键成像模态。尽管近期进展在自监督学习和掩码图像建模 (MIM) 使能了 SAR 基础模型,但这些方法主要关注低级视觉特征,往往忽视多模态表示。此外,SAR 的多模态数据稀缺,限制了稳健的跨模态模型的开发。为解决这一限制,我们构建了 SARVLM-1M,一个包含超过一百万个图像-文本对的大规模视觉-语言数据集,汇自现有数据集。进一步,为缓解 SAR 与自然图像之间的显著差异,我们提出了两种阶段的域转换训练策略,利用光学遥感数据作为中间桥梁,促进从自然图像到 SAR 领域的有效知识迁移。基于此策略,我们开发了 SARVLM,即首个专为 SAR 设计的视觉-语言基础模型,包含 SARCLIP 和 SARCap。此外,利用集成策略可提高模型的跨场景泛化能力。实验还验证了 SARDet 和 SARRot 在目标检测中的能力。在图像-文本检索、目标识别、零样本分类、目标检测、语义定位和图像描述等 13 个基准测试上的大量实验表明,SARVLM 在特征提取和解释能力方面显著优于最先进的视觉-语言模型,推动了 SAR 图像的语义理解。代码和数据集将发布于 https://github.com/KlayMa527/SARVLM.git。
引用
@article{arxiv.2510.22665,
title = {SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery},
author = {Qiwei Ma and Xukun Lu and Wang Liu and Puhong Duan and Xudong Kang and Shutao Li},
journal= {arXiv preprint arXiv:2510.22665},
year = {2026}
}
备注
13 pages, 13 figures