Landsat30-AU: 用于澳大利亚 Landsat 影像的视觉语言数据集
计算机视觉与模式识别
2025-11-18 v3 人工智能
摘要
视觉语言模型 (VLM) 通过自然语言交互处理卫星影像, 可加速专家工作流程, 使数据易于非专业人士获取, 并实现地球范围的自动化。然而, 现有数据集主要聚焦于短期高分辨率影像及来自有限卫星的数据, 忽略了低分辨率、跨卫星、长期档案数据——如 Landsat 数据, 其对可负担且抗偏差的全球监测至关重要。为填补这一空白, 我们构建 Landsat30-AU, 一个由四颗 Landsat 卫星 (5, 7, 8, 9) 收集、覆盖澳大利亚、跨越 36 年、分辨率为 30米的大规模视觉语言数据集。该数据集包含两个组成部分: Landsat30-AU-Cap, 包含 张图像-文本对; 以及 Landsat30-AU-VQA, 包含 17,725 份经人工验证的视觉问答样本, 覆盖八大遥感领域。两者均通过利用通用 VLM 进行引导式构建、迭代细化并经人工核查确保数据质量。我们在本基准上评估了八种 VLM, 发现即插即用模型难以理解卫星影像。EarthDial 一种开源遥感 VLM 在描述生成与 VQA 任务中分别仅达 0.07 SPIDEr 与 0.48 的准确率, 凸显当前方法的局限性。值得欣慰的是, 对 Qwen2.5-VL-7B 进行轻量级微调后, 描述生成性能从 0.11 提升至 0.31 SPIDEr, VQA 准确率从 0.74 提升至 0.87。代码与数据已开源于 https://github.com/papersubmit1/landsat30-au。
引用
@article{arxiv.2508.03127,
title = {Landsat30-AU: A Vision-Language Dataset for Australian Landsat Imagery},
author = {Sai Ma and Zhuang Li and John A Taylor},
journal= {arXiv preprint arXiv:2508.03127},
year = {2025}
}