策略性数据收集能否提升贫困预测模型性能?
机器学习
2022-11-17 v1
摘要
基于机器学习的贫困与财富估计正日益被用于指导人道主义援助定向与社会救助分配。然而,用于训练这些模型的真实标签通常借自现有调查,而这些调查旨在产生国家统计——而非训练机器学习模型。在此,我们检验真实数据收集的自适应抽样策略能否改善贫困预测模型的性能。通过模拟,我们将现状抽样策略(均匀随机抽样与分层随机抽样)与基于模型不确定性或子群体上模型表现优先获取训练数据的替代方案进行比较。或许令人惊讶的是,我们发现这些主动学习方法均未能优于均匀随机抽样。我们讨论了这些结果如何有助于塑造未来改进基于机器学习的贫困估计的努力。
引用
@article{arxiv.2211.08735,
title = {Can Strategic Data Collection Improve the Performance of Poverty Prediction Models?},
author = {Satej Soman and Emily Aiken and Esther Rolf and Joshua Blumenstock},
journal= {arXiv preprint arXiv:2211.08735},
year = {2022}
}
备注
Artificial Intelligence for Humanitarian Assistance and Disaster Response Workshop, 36th Conference on Neural Information Processing Systems (NeurIPS 2022)