中文

基于降维的数据驱动社会经济剥夺预测:扩散映射的威力

机器学习 2025-09-29 v2 计算工程、金融与科学

摘要

本研究提出了一种利用人口普查数据预测城市中最贫困区域位置的模型。人口普查数据维度非常高,需要进行简化。我们使用扩散映射算法来降维并寻找模式。特征由定义扩散映射的拉普拉斯矩阵的特征向量定义。对应于最小特征值的特征向量指示了人口的具体特征。先前的工作定性发现,用于描述英国布里斯托尔人口普查数据的第二重要维度与剥夺有关。在本研究中,我们通过将其与公认的指标进行比较,分析该维度作为预测剥夺的模型的效果。发现 Pearson 相关系数大于 0.7。提取了英国同样位于布里斯托尔的前 10% 的最贫困区域,以测试模型的准确性。共有 52 个最贫困区域,通过与模型比较,正确识别了 38 个区域。与模型不相关的 IMD 域分数以及非贫困 Output Area 的 Eigenvector 2 条目的影响,导致模型未能预测出 14 个贫困区域。该模型在预测项目区域的未来剥夺方面表现出强大的性能,有望极大地辅助政府资源分配和资金投入。代码可在此处获取:https://github.com/junegoo94/diffusion_maps

关键词

引用

@article{arxiv.2312.09830,
  title  = {Data-Driven Socio-Economic Deprivation Prediction via Dimensionality Reduction: The Power of Diffusion Maps},
  author = {June Moh Goo},
  journal= {arXiv preprint arXiv:2312.09830},
  year   = {2025}
}

备注

Accepted to 2024 IEEE International Conference on Big Data (IEEE Big Data 2024)