中文

Sentinel2Cap:面向多模态遥感图像描述的数据集

计算机视觉与模式识别 2026-05-06 v1

摘要

图像描述已成为计算机视觉中的重要任务,使模型能够生成视觉内容的自然语言描述。虽然已存在针对自然图像和高分辨率光学遥感图像的数据集,但针对多模态卫星数据的描述数据集仍显有限,尤其是针对SAR图像和中分辨率传感器。我们引入Sentinel2Cap,一个包含Sentinel-1 SAR和Sentinel-2多光谱图像块的数据集,分辨率为10米和20米,包含多样化的土地覆盖构成。数据集中的描述由人工创建并仔细验证,以确保语义准确性和语言质量。为评估Sentinel2Cap,我们使用Qwen3-VL-8B-Instruct模型进行零样本描述,覆盖三个图像模态:RGB、多光谱和SAR伪RGB表示。结果表明,RGB图像实现了最高的描述性能,而SAR图像对视觉语言模型仍具有挑战性。提供模态特定的上下文提示在所有指标上均一致地提高了性能。这些发现既凸显了多模态遥感图像描述的挑战,也强调了人工标注数据集在推动跨模态场景理解研究方面的潜在价值。所有材料均公开可用。

关键词

引用

@article{arxiv.2605.03189,
  title  = {Sentinel2Cap: A Human-Annotated Benchmark Dataset for Multimodal Remote Sensing Image Captioning},
  author = {Lucrezia Tosato and Gianluca Lombardi and Ronny Hansch},
  journal= {arXiv preprint arXiv:2605.03189},
  year   = {2026}
}

备注

10 pages, 6 figures, 5 tables