预算有限下的空间数据收集优化: 面向机器学习
机器学习
2025-09-05 v1 计算机视觉与模式识别
摘要
在农业、生态学和人类发展等领域,卫星图像机器学习 (SatML) 受限于标记训练数据的稀疏性。尽管卫星数据覆盖全球,但用于 SatML 的标记训练数据集往往规模小、空间聚集,且为其他目的(如行政调查或现场测量)收集。尽管存在这一实际问题,但过去的 SatML 研究主要关注新型模型架构和训练算法以处理稀缺训练数据,而非直接建模数据收集条件。这让希望利用 SatML 进行大规模监测的科学家和政策制定者对是否应收集额外数据以最大化性能感到不确定。本文提出了第一个针对异构数据收集成本和现实预算约束条件下空间训练数据优化问题的形式化表述,以及相应的新方法。在跨三个大洲和四个任务的不同情景模拟实验中,我们的方法显示出显著的样本优化收益。进一步实验描绘了优化抽样在何种情况下尤其有效。我们提出的问题表述和方法旨在跨应用领域泛化;我们特别强调了一个特定情景,使得我们的共同作者能够立即利用我们的发现来增强尼日利亚当地农业调查,以支持 SatML 监测。
引用
@article{arxiv.2509.03749,
title = {Mapping on a Budget: Optimizing Spatial Data Collection for ML},
author = {Livia Betti and Farooq Sanni and Gnouyaro Sogoyou and Togbe Agbagla and Cullen Molitor and Tamma Carleton and Esther Rolf},
journal= {arXiv preprint arXiv:2509.03749},
year = {2025}
}