BigEarthNet.txt:面向地球观察的大规模多传感器图像-文本数据集与基准
计算机视觉与模式识别
2026-04-02 v2
摘要
视觉-语言模型(VLMs)在计算机视觉中显示出强大的性能,但在遥感数据上的性能仍有限,这主要由于缺乏规模大、多传感器遥感图像-文本数据集且文本注释具有多样性。现有数据集主要包括航空红绿蓝图像, caption 短或缺乏 grounding,且提供的注释类型有限。为解决这一限制,我们引入 BigEarthNettxt,一个大规模、多传感器图像-文本数据集,旨在推动地球观察中跨多个任务的指令驱动图像-文本学习。BigEarthNettxt 包含 464044 对齐的 Sentinel-1 合成孔径雷达和 Sentinel-2 多光谱图像,包含 960 万文本注释,包括:i) 描述土地利用/土地覆盖(LULC)类别、其空间关系和环境背景的地理锚定 caption;ii) 与不同任务相关的视觉问答对;iii) 用于边界框预测的指称表达检测指令。通过比较统计分析,我们证明 BigEarthNettxt 在文本丰富性和注释类型多样性方面优于现有的遥感图像-文本数据集。我们进一步建立了一个经过手动验证的基准划分来评估 VLMs 在遥感和计算机视觉中的表现。结果显示这些模型在涉及复杂 LULC 类别的任务方面的局限性,而使用 BigEarthNettxt 进行微调在所有考虑的任务中都实现了持续的性能提升。
引用
@article{arxiv.2603.29630,
title = {BigEarthNet.txt: A Large-Scale Multi-Sensor Image-Text Dataset and Benchmark for Earth Observation},
author = {Johann-Ludwig Herzog and Mathis Jürgen Adler and Leonard Hackel and Yan Shu and Angelos Zavras and Ioannis Papoutsis and Paolo Rota and Begüm Demir},
journal= {arXiv preprint arXiv:2603.29630},
year = {2026}
}
备注
For details, see https://txt.bigearth.net