中文

面向农田分割的大规模图文数据集基准

计算机视觉与模式识别 2025-04-01 v1 计算与语言

摘要

仅依赖标注数据的传统深度学习范式在表示农田要素与周围环境之间的空间关系方面存在局限性。它难以有效地建模农田的动态时间演化和空间异质性。语言作为一种结构化的知识载体,能够显式表达农田的时空特征,如其形状、分布以及周围环境信息。因此,语言驱动的学习范式能够有效缓解农田时空异质性带来的挑战。然而,在农田遥感影像领域,目前尚无综合的基准数据集来支持这一研究方向。为了填补这一空白,我们引入了基于语言的农田描述,并开发了 FarmSeg-VL 数据集,这是首个专为时空农田分割设计的细粒度图文数据集。首先,本文提出了一种半自动标注方法,能够准确为每幅图像分配描述文本,在确保高数据质量和语义丰富度的同时,提高了数据集构建的效率。其次,FarmSeg-VL 展现出显著的时空特征。在时间维度上,它涵盖了四季;在空间维度上,它覆盖了中国八个典型农业区。此外,在描述文本方面,FarmSeg-VL 涵盖了农田丰富的时空特征,包括其固有属性、物候特征、空间分布、地形地貌特征以及周围环境的分布。最后,我们对在 FarmSeg-VL 上训练的视觉语言模型(VLM)和仅依赖标签的深度学习模型进行了性能分析,证明了其作为农田分割标准基准的潜力。

关键词

引用

@article{arxiv.2503.23106,
  title  = {A large-scale image-text dataset benchmark for farmland segmentation},
  author = {Chao Tao and Dandan Zhong and Weiliang Mu and Zhuofei Du and Haiyang Wu},
  journal= {arXiv preprint arXiv:2503.23106},
  year   = {2025}
}