中文

SARLANG-1M:面向SAR图像理解的视觉语言建模基准

计算机视觉与模式识别 2025-04-07 v1

摘要

合成孔径雷达是一种关键的遥感技术,能够实现全天候、昼夜观测,并具有较强的地表穿透能力,用于精确和连续的环境监测与分析。然而,由于其复杂的物理成像机制以及与人类视觉感知的显著差异,SAR图像解译仍然具有挑战性。近年来,视觉语言模型在RGB图像理解方面取得了显著成功,提供了强大的开放词汇解译和灵活的语言交互能力。然而,它们在SAR图像上的应用受到训练分布中缺乏SAR特定知识的严重限制,导致性能欠佳。为解决这一局限,我们引入了SARLANG-1M,这是一个专为多模态SAR图像理解定制的大规模基准,主要关注将SAR与文本模态集成。SARLANG-1M包含来自全球59个以上城市的超过100万对高质量SAR图像-文本对。它具有分层分辨率(范围从0.1米到25米)、细粒度语义描述(包括简洁和详细描述)、多样化的遥感类别(1696种物体类型和16种土地覆盖类别)以及涵盖七个应用领域和1012种问题类型的多任务问答对。在主流视觉语言模型上的大量实验表明,使用SARLANG-1M进行微调显著提升了它们在SAR图像解译中的性能,达到了与人类专家相当的水平。数据集和代码将在https://github.com/Jimmyxichen/SARLANG-1M公开提供。

关键词

引用

@article{arxiv.2504.03254,
  title  = {SARLANG-1M: A Benchmark for Vision-Language Modeling in SAR Image Understanding},
  author = {Yimin Wei and Aoran Xiao and Yexian Ren and Yuting Zhu and Hongruixuan Chen and Junshi Xia and Naoto Yokoya},
  journal= {arXiv preprint arXiv:2504.03254},
  year   = {2025}
}