数据稀缺环境下的家庭贫困分类:一种机器学习方法
机器学习
2017-11-21 v1 应用统计
摘要
我们描述了一种通过利用全国代表性家庭调查中包含的信息来识别数据稀缺国家中贫困家庭的方法。它采用标准统计学习技术——交叉验证和参数正则化——二者共同减少了模型过拟合以匹配观测调查数据特殊性的程度。该自动化框架满足这一发展背景下的三个重要约束:i)预测模型至多使用十个问题,限制了数据收集成本;ii)在收集到十个指标的数据后,计算给定家庭贫困概率无需除简单算术之外的任何计算;iii)模型的一种设定(即一张计分卡)用于预测可能具有显著国内地区差异的整个国家的贫困。使用来自赞比亚的调查数据,该模型的样本外预测利用十个问题中包含的信息区分贫困与非贫困家庭。
引用
@article{arxiv.1711.06813,
title = {Household poverty classification in data-scarce environments: a machine learning approach},
author = {Varun Kshirsagar and Jerzy Wieczorek and Sharada Ramanathan and Rachel Wells},
journal= {arXiv preprint arXiv:1711.06813},
year = {2017}
}
备注
Presented at NIPS 2017 Workshop on Machine Learning for the Developing World, 7 pages with 4 figures