中文

微观样本中机器学习的预测波动性:区域贫困的正则化评估

统计方法学 2026-05-19 v2 计算机与社会 应用统计

摘要

识别区域数据集中的贫困结构性驱动因素经常受到小样本量和高维共线性的阻碍,这可能导致不稳定和误导性的政策建议。本文通过解决这些特定的统计风险,评估了印度尼西亚各省的贫困成因。我们采用了一个针对小样本(n=34)且高共线性设计的严格模型比较框架,比较了标准线性模型与频率学派惩罚方法、贝叶斯收缩先验、调整后的空间内在条件自回归(ICAR)模型以及复杂的机器学习集成。为确保稳健的评估,我们使用严格的留一交叉验证(LOOCV)衡量预测性能。结果表明,算法复杂性在区域数据集中固有地存在风险:简单的线性收缩模型(Ridge、Elastic Net、LASSO)实现了优越的样本外预测,而复杂的集成模型如BART则遭受严重过拟合。在所有成功的正则化模型中,ICT技能始终作为最稳定的省级贫困代理指标出现。本论文的主要贡献在于证明,在数据受限的区域分析中,参数化正则化的线性收缩比朴素OLS或无约束机器学习为隔离结构性发展优先事项(如ICT)提供了更可靠的数学基础。

关键词

引用

@article{arxiv.2604.06278,
  title  = {Predictive Volatility of Machine Learning in Micro-Samples: A Regularised Assessment of Regional Poverty},
  author = {A. H. Jamaluddin and A. T. R. Dani and N. I. Mahat and V. Ratnasari and S. S. M. Fauzi},
  journal= {arXiv preprint arXiv:2604.06278},
  year   = {2026}
}