中文

BigEarthNet.txt:面向地球观察的大规模多传感器图像-文本数据集与基准

计算机视觉与模式识别 2026-04-02 v2

摘要

视觉-语言模型(VLMs)在计算机视觉中显示出强大的性能,但在遥感数据上的性能仍有限,这主要由于缺乏规模大、多传感器遥感图像-文本数据集且文本注释具有多样性。现有数据集主要包括航空红绿蓝图像, caption 短或缺乏 grounding,且提供的注释类型有限。为解决这一限制,我们引入 BigEarthNet..txt,一个大规模、多传感器图像-文本数据集,旨在推动地球观察中跨多个任务的指令驱动图像-文本学习。BigEarthNet..txt 包含 464044 对齐的 Sentinel-1 合成孔径雷达和 Sentinel-2 多光谱图像,包含 960 万文本注释,包括:i) 描述土地利用/土地覆盖(LULC)类别、其空间关系和环境背景的地理锚定 caption;ii) 与不同任务相关的视觉问答对;iii) 用于边界框预测的指称表达检测指令。通过比较统计分析,我们证明 BigEarthNet..txt 在文本丰富性和注释类型多样性方面优于现有的遥感图像-文本数据集。我们进一步建立了一个经过手动验证的基准划分来评估 VLMs 在遥感和计算机视觉中的表现。结果显示这些模型在涉及复杂 LULC 类别的任务方面的局限性,而使用 BigEarthNet..txt 进行微调在所有考虑的任务中都实现了持续的性能提升。

关键词

引用

@article{arxiv.2603.29630,
  title  = {BigEarthNet.txt: A Large-Scale Multi-Sensor Image-Text Dataset and Benchmark for Earth Observation},
  author = {Johann-Ludwig Herzog and Mathis Jürgen Adler and Leonard Hackel and Yan Shu and Angelos Zavras and Ioannis Papoutsis and Paolo Rota and Begüm Demir},
  journal= {arXiv preprint arXiv:2603.29630},
  year   = {2026}
}

备注

For details, see https://txt.bigearth.net