面向数据高效土地覆盖分割的核心集选择
计算机视觉与模式识别
2025-12-19 v3
摘要
遥感数据的日益可及性及其支持大规模决策的潜力,推动了面向众多地球观测任务的深度学习模型的发展。传统上,此类模型依赖于大型数据集。然而,认为更大的训练数据集能带来更好性能的普遍假设,往往忽视了与数据冗余、噪声以及处理海量数据集的计算成本相关的问题。因此,有效的解决方案不仅必须考虑数据的数量,还要考虑其质量。为此,本文引入了六种基本的核心集选择方法——它们仅依赖影像、仅依赖标签,或结合两者——并研究它们能否识别出高质量的数据子集,使其在遥感语义分割中能够维持——甚至超越——使用完整数据集时所达到的性能。我们在三个广泛使用的土地覆盖分类数据集(DFC2022、Vaihingen 和 Potsdam)上,使用两种不同的架构(SegFormer 和 U-Net),将这些方法与两个传统基线进行了基准测试,从而为未来的工作建立了一个通用基线。我们的实验表明,所有提出的方法在多个子集大小上均一致优于基线,其中一些方法甚至选出了性能超越使用所有可用数据训练的核心集。值得注意的是,在 DFC2022 上,仅包含 25% 训练数据的选定子集,其 SegFormer 性能略高于使用整个数据集进行训练。这一结果显示了以数据为中心的学习在遥感领域的重要性和潜力。代码可在 https://github.com/keillernogueira/data-centric-rs-classification/ 获取。
引用
@article{arxiv.2505.01225,
title = {Core-Set Selection for Data-efficient Land Cover Segmentation},
author = {Keiller Nogueira and Akram Zaytar and Wanli Ma and Ribana Roscher and Ronny Hansch and Caleb Robinson and Anthony Ortiz and Simone Nsutezo and Rahul Dodhia and Juan M. Lavista Ferres and Oktay Karakus and Paul L. Rosin},
journal= {arXiv preprint arXiv:2505.01225},
year = {2025}
}