中文

SAR-TEXT:基于 SAR-Narrator 构建的大规模 SAR 图文数据集及面向下游任务的渐进式学习策略

计算机视觉与模式识别 2025-10-07 v3

摘要

近年来,视觉语言模型(VLM)在遥感领域取得了显著突破。合成孔径雷达(SAR)影像凭借其全天候能力,在遥感中不可或缺,但缺乏大规模、高质量的 SAR 图文数据集阻碍了其语义理解。本文构建了 SAR-TEXT,一个包含超过 130,000 对 SAR 图文对的大规模高质量数据集。为构建 SAR-TEXT 数据集,我们设计了 SAR-Narrator 框架,通过多阶段策略为 SAR 图像生成文本描述。为验证 SAR-TEXT 数据集的有效性,我们在三个典型的视觉语言任务上进行了实验:图文检索、图像描述和视觉问答(VQA)。具体而言,我们在 SAR-TEXT 上构建了三个代表性模型:SAR-RS-CLIP、SAR-RS-CoCa 和 SAR-GPT。SAR-RS-CLIP 在检索性能上取得显著提升,在 OSdataset_512 和 HRSID 测试集上的平均召回率分别提升了 12.97% 和 10.0%。在图像描述任务中,SAR-RS-CoCa 在 BLEU-4、SPICE 和 CIDEr 分数上较原始 CoCa 模型取得显著提升。在 VQA 任务中,SAR-GPT 在多个 SAR-VQA 数据集上优于基线及单阶段模型,展现出更强的语义理解与推理能力,定性结果进一步证实了这一点。值得注意的是,作为一种灵活的描述生成工具,SAR-Narrator 可被社区轻松采用以构建更大规模的 SAR 图文数据集。所有代码、预训练模型及 SAR-Text 数据集均公开于:https://github.com/YiguoHe/SAR-TEXT。

关键词

引用

@article{arxiv.2507.18743,
  title  = {SAR-TEXT: A Large-Scale SAR Image-Text Dataset Built with SAR-Narrator and A Progressive Learning Strategy for Downstream Tasks},
  author = {Yiguo He and Xinjun Cheng and Junjie Zhu and Chunping Qiu and Jun Wang and Xichuan Zhang and Qiangjuan Huang and Ke Yang},
  journal= {arXiv preprint arXiv:2507.18743},
  year   = {2025}
}

备注

IEEE Submission