基于最小描述长度原则的多分辨率人口数据线性模型识别以预测家庭收入
机器学习
2021-01-07 v3 计算机与社会
应用统计
统计方法学
机器学习
摘要
一件衬衫的尺寸无法适合所有人,而由于资源限制我们也无法为每个人制作一件完全合身的独特衬衫。这一类比对政策制定同样成立。政策制定者无法建立单一政策解决所有地区的所有问题,因为每个地区都有其独特问题。另一极端,由于资源限制,政策制定者也无法为每个小村庄单独制定政策。如果我们能找到一组最大的区域,使得该组内每个区域的人口具有共性问题,从而可为其制定单一政策,是否会更好?本工作中,我们提出一个利用回归分析与最小描述长度(MDL)的框架,以寻找具有共同指标的一组最大区域,可用于高效预测家庭收入。给定一组家庭特征,以及一个表示行政区划的多分辨率划分,我们的框架报告一组最大的子分区 C*,其对人口-收入预测具有共同模型。我们形式化了寻找 C* 的问题并提出相应算法作为解决方案。我们使用模拟数据集以及泰国人口家庭信息的真实数据集来展示框架性能与应用。结果表明我们的框架性能优于基线方法。我们展示了方法结果可用于寻找泰国许多地区收入预测的指示变量。通过提升这些指标值,我们期望这些地区人们获得更高收入。因此,政策制定者可计划以我们结果中的这些指标为指南建立政策以解决低收入问题。我们的框架可支持政策制定者为收入以外的任何其它因变量建立政策,以对抗贫困及其他问题。
引用
@article{arxiv.1907.05234,
title = {Identifying Linear Models in Multi-Resolution Population Data using Minimum Description Length Principle to Predict Household Income},
author = {Chainarong Amornbunchornvej and Navaporn Surasvadi and Anon Plangprasopchok and Suttipong Thajchayapong},
journal= {arXiv preprint arXiv:1907.05234},
year = {2021}
}
备注
This is the accepted manuscript for publication in TKDD. The R package is available at https://github.com/DarkEyes/MRReg