中文

YieldSAT:面向高分辨率作物产量预测的多模态基准数据集

计算机视觉与模式识别 2026-04-02 v1

摘要

作物产量预测需要大量数据来训练可扩展的模型。然而,创建产量预测数据集受制于高昂的获取成本、数据质量的异质性以及数据隐私法规的限制。因此,现有数据集稀缺、质量较低,或仅覆盖区域级别或单一作物类型,阻碍了基于数据驱动的可扩展解决方案的开发。本文发布了 YieldSAT,这是一个规模大、质量高、用于高分辨率作物产量预测的多模态数据集。YieldSAT 跨越多个国家多个气候区,包括阿根廷、巴西、乌拉圭和德国,包含玉米、油菜、大豆和小麦等主要作物,涵盖 2,173 个专家精选的田块。总计超过 1220 万个产量样本,每个样本的空间分辨率为 10 米。每个田块配有多光谱卫星影像,累计 113,555 张标注卫星影像,并辅以环境数据。我们通过比较 various 深度学习模型和数据融合架构,展示了大规模高分辨率作物产量预测作为像素回归任务的潜力。此外,我们强调在现实条件下,由于地面真值数据存在严重分布偏移所引发的开放性挑战。为缓解此问题,我们探索了一种基于域信息的深度集成方法,该方法显示出显著的性能提升。该数据集可在 https://yieldsat.github.io/ 获取。

关键词

引用

@article{arxiv.2604.00940,
  title  = {YieldSAT: A Multimodal Benchmark Dataset for High-Resolution Crop Yield Prediction},
  author = {Miro Miranda and Deepak Pathak and Patrick Helber and Benjamin Bischke and Hiba Najjar and Francisco Mena and Cristhian Sanchez and Akshay Pai and Diego Arenas and Matias Valdenegro-Toro and Marcela Charfuelan and Marlon Nuske and Andreas Dengel},
  journal= {arXiv preprint arXiv:2604.00940},
  year   = {2026}
}