中文

SARChat-Bench-2M:用于合成孔径雷达图像解释的大规模多任务视觉语言基准

计算与语言 2025-03-05 v5

摘要

作为强大的全天候地球观测工具,合成孔径雷达(SAR)遥感技术使其能够实现关键的军事侦察、海上监视和基础设施监测。尽管视觉语言模型(VLM)在自然语言处理和图像理解方面取得了显著进展,但其在专业领域的应用仍受限于缺乏足够的领域专业知识。本文创新性地提出首个大规模多模态对话数据集,用于SAR图像,命名为SARChat-2M,包含约200万组高质量图像-文本对,涵盖多种场景并提供详细目标标注。该数据集不仅支持视觉理解和目标检测等关键任务,还具有独特的创新性:本研究构建了SAR领域的视觉-语言数据集和基准,使VLMs在SAR图像解释方面的能力得以评估,为构建跨各种遥感垂直领域的多模态数据集提供了范式框架。通过在16个主流VLMs上的实验,充分验证了该数据集的有效性。项目将在https://github.com/JimmyMa99/SARChat 上发布。

关键词

引用

@article{arxiv.2502.08168,
  title  = {SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation},
  author = {Zhiming Ma and Xiayang Xiao and Sihao Dong and Peidong Wang and HaiPeng Wang and Qingyun Pan},
  journal= {arXiv preprint arXiv:2502.08168},
  year   = {2025}
}