中文

用于高维调查数据特征选择的模糊森林:以2020年美国总统大选为例

机器学习 2022-03-08 v1 机器学习

摘要

在社会科学领域,一个日益常见的方法论问题是高维且高度相关的数据集,这类数据难以适用传统的演绎研究框架。2020年总统大选中候选人选择的分析就是这一问题显现的领域之一:为了检验解释选举结果的诸多理论,有必要使用如2020年合作选举研究通用内容(2020 Cooperative Election Study Common Content)这样具有数百个高度相关特征的数据。我们提出模糊森林(Fuzzy Forests)算法,即流行的随机森林(Random Forests)集成方法的一种变体,作为在此类情况下以最小偏差缩减特征空间的高效方法,同时保持与随机森林和logit等常见算法相当的预测性能。利用模糊森林,我们分离出候选人选择的最强相关因素,发现党派极化是驱动2020年总统大选的最强因素。

关键词

引用

@article{arxiv.2203.02818,
  title  = {Fuzzy Forests For Feature Selection in High-Dimensional Survey Data: An Application to the 2020 U.S. Presidential Election},
  author = {Sreemanti Dey and R. Michael Alvarez},
  journal= {arXiv preprint arXiv:2203.02818},
  year   = {2022}
}

备注

Paper presented at The 3rd International Conference on Applied Machine Learning and Data Analytics, December 16-17 2021, where it was named the Best Paper of the conference