用随机森林预测美国政策结果
计算机与社会
2020-08-18 v1 机器学习
摘要
Gilens、Page 等人(2014)整理并分析了一个详细数据集,涵盖二十年来美国政府的立法结果,以及富人、普通民众和不同利益集团的政策偏好。他们发现,富人的偏好与政策结果高度相关,而普通民众的偏好则不然,除非通过与富人偏好的关联。他们的分析运用了经典统计推断工具,特别是 logistic 回归。本文中,我们使用机器学习中的互补工具——随机森林分类器(RFs)来分析 Gilens 数据集。我们提出两个主要发现,分别关于预测与推断:(i)仅依据富人及少数强势利益集团的偏好以及政策领域标签,模型便能以约 70% 的平衡准确率预测留出测试集。这些结果包括回溯预测,即训练于 1997 年前案例的模型预测“未来”(1997 年后)案例。在该详尽但含噪的数据集中,相较基线(随机)准确率提升 20%,表明少数富裕参与者在美国政策结果中的高度重要性,并与一系列表明美国政府具有显著寡头倾向的研究相吻合。(ii)RF 模型的特征选择方法识别出尤为显著的利益集团(经济参与者)子集。这些可用于进一步研究政府决策动态,也为此类数据集上 RF 特征选择方法用于推断的潜在价值提供了范例。
引用
@article{arxiv.2008.07338,
title = {Predicting United States policy outcomes with Random Forests},
author = {Shawn McGuire and Charles Delahunt},
journal= {arXiv preprint arXiv:2008.07338},
year = {2020}
}
备注
13 pages, 2 figures